双机本地模型办公方案
双机本地模型办公方案
基于两台主机的配置评估与本地 AI 工作流方案,涵盖设计、视频、文案三大方向。
一、两台主机配置对比分析
1.1 基础配置一览
| 配置项 |
主机 A (主力机) |
主机 B (辅助机) |
| CPU |
i9-13900KF,24核32线程,3.0GHz 基础 |
i7-12700,12核20线程,2.10GHz |
| 内存 |
64GB DDR5 |
64GB DDR4 2400MT/s |
| 显卡 |
RTX 4090 24GB 显存 |
RTX 3080 10GB 显存 |
| 硬盘 |
4.55TB 总量,已用 3.65TB(剩余 ~900GB) |
5.46TB 总量,已用 3.95TB(剩余 ~1.51TB) |
1.2 各维度评分对比
| 评估维度 |
主机 A |
主机 B |
说明 |
| 大模型推理能力 |
10/10 |
7/10 |
4090 的 24GB 显存可流畅运行 Qwen2.5-72B(Q4 量化)、Llama-3.3-70B 等顶级模型;3080 的 10GB 仅适合 7B~14B 级别 |
| 图像生成能力 |
10/10 |
8/10 |
4090 可跑 Flux.1-dev FP16 满血版 + SUPIR 4K 放大;3080 跑 SDXL 和 Flux FP8 仍胜任 |
| 视频生成能力 |
10/10 |
5/10 |
4090 可运行 Wan2.1-14B、HunyuanVideo 等视频模型;10GB 显存几乎无法本地跑视频生成大模型 |
| 多任务并行 |
9/10 |
8/10 |
主机 A 的 CPU 核心数更高,但两台均为 64GB 内存,均可多服务并行 |
| 存储空间 |
5/10 |
6/10 |
主机 A 剩余仅约 900GB,严重不足;主机 B 剩余约 1.51TB,略有余量 |
| 综合评分 |
9.3/10 |
6.8/10 |
主机 A 为绝对主力;主机 B 适合辅佐、知识库、批量处理等非实时任务 |
1.3 角色定位
- 主机 A (i9+4090):AI 算力主力。承担所有高负载任务:大模型推理、图像/视频生成、实时交互式 AI 应用。
- 主机 B (i7+3080):辅助工作站 + 知识库服务器。承担 RAG 知识库服务、批量文档处理、Stable Diffusion 基础出图、数据存储与备份。
二、本地大模型选型推荐
2.1 主机 A 适用模型(24GB 显存)
| 模型名称 |
参数量 |
推荐量化 |
显存占用 |
适用场景 |
| Qwen2.5-72B-Instruct |
72B |
Q4_K_M |
~40GB(部分 offload 内存) |
综合中文文案、深度分析 |
| Llama-3.3-70B-Instruct |
70B |
Q4_K_M |
~40GB |
英文创作、通用推理 |
| DeepSeek-R1-Distill-Llama-70B |
70B |
Q4_K_M |
~40GB |
强推理任务、复杂逻辑分析 |
| Qwen2.5-32B-Instruct |
32B |
Q5_K_M |
~22GB(全 GPU) |
日常文案主力,速度与质量平衡 |
| DeepSeek-Coder-V2-Instruct |
16B/236B |
Q4_K_M (16B) |
~10GB |
代码辅助 |
| Qwen2.5-14B-Instruct |
14B |
Q8 |
~14GB |
轻量快速响应 |
推荐策略:日常文案用 Qwen2.5-32B(全 GPU 加载,速度快);重度推理切换到 DeepSeek-R1-Distill(部分 offload 至 64GB 内存)。
2.2 主机 B 适用模型(10GB 显存)
| 模型名称 |
参数量 |
推荐量化 |
显存占用 |
适用场景 |
| Qwen2.5-14B-Instruct |
14B |
Q4_K_M |
~8GB |
中文对话、知识库问答 |
| Llama-3.1-8B-Instruct |
8B |
Q8 |
~8GB |
英文文案、快速对话 |
| DeepSeek-R1-Distill-Qwen-7B |
7B |
Q5_K_M |
~6GB |
推理辅助 |
| Phi-4-14B |
14B |
Q4_K_M |
~8GB |
逻辑分析(微软出品,小参数高智商) |
| nomic-embed-text |
0.14B |
— |
~0.3GB |
文本向量化(RAG 嵌入模型) |
| BGE-M3 |
0.5B |
— |
~1GB |
多语言中文向量化 |
推荐策略:主机 B 部署 Qwen2.5-14B 作为 RAG 知识库后端,辅以 BGE-M3 嵌入模型。
2.3 推理框架选型
| 框架 |
适用机型 |
特点 |
| Ollama |
两台均适用 |
命令行一键部署,REST API 原生支持,生态最丰富 |
| LM Studio |
推荐主机 B |
GUI 图形界面,零代码操作,适合非技术场景 |
| vLLM |
主机 A(高级用户) |
高吞吐推理引擎,适合生产级 API 服务 |
| llama.cpp |
两台均适用 |
底层推理库,Ollama 底层即基于此 |
三、设计方向工作流方案
3.1 图像生成平台
| 平台 |
适用主机 |
说明 |
| ComfyUI |
主机 A(主力)/ 主机 B(辅助) |
节点式工作流,灵活度最高,2025 行业标准 |
| Stable Diffusion WebUI (Forge) |
主机 B |
对显存优化好,适合 10GB 显卡,操作直观 |
3.2 推荐模型清单
主机 A (RTX 4090) — 设计模型
| 模型 |
类型 |
适用场景 |
| Flux.1-dev |
基础大模型 |
超写实渲染、文字海报、商业设计(FP16 满血可跑) |
| Juggernaut XL V11 |
SDXL 微调 |
商业级写实人像与场景 |
| Animagine XL V3.1 |
SDXL 微调 |
二次元角色设计 |
| SD3.5-Medium |
DiT 架构 |
提示词遵从度高,构图能力强 |
主机 B (RTX 3080) — 设计模型
| 模型 |
类型 |
适用场景 |
| Flux.1-dev FP8 |
量化大模型 |
基础设计出图 |
| Juggernaut XL |
SDXL |
写实类生成 |
| DreamShaper XL |
SDXL |
艺术风格、概念设计 |
3.3 典型工作流
工作流 A:超写实商业渲染(主机 A 专属)
线稿/草图 → ControlNet Canny/Depth → SDXL/Flux 生成 1024×1024
→ SUPIR 4K 放大修复 → Adobe Lightroom 后期调色
SUPIR 是当前最强 AI 放大模型,需 24GB 显存,主机 A 独占运行。
工作流 B:IP 一致性系列设计(两台协作)
角色参考图 → IP-Adapter FaceID(主机 A)→ 批量生成不同场景
→ 主机 B 批量 Inpaint 修正 → Figma/PS 排版输出
工作流 C:创意海报(含文字)
提示词(含完整文字内容)→ Flux.1-dev(主机 A)
→ ControlNet QR Code Monster 创意融合 → 4K 输出
3.4 关键插件与工具
| 工具/插件 |
用途 |
部署位置 |
| ComfyUI-Manager |
插件管理 |
两台均装 |
| IP-Adapter |
角色/风格一致性 |
主机 A |
| ControlNet(Canny/Depth/QRCode) |
构图控制 |
两台均装 |
| SUPIR |
4K 超分放大 |
主机 A 专属 |
| Topaz Gigapixel AI |
商业级放大备选 |
主机 A |
| Upscayl |
免费开源放大 |
主机 B |
四、视频处理方向工作流方案
4.1 视频生成模型选型
| 模型 |
参数量 |
显存需求 |
部署位置 |
特点 |
| Wan2.1-14B |
14B |
≥24GB (FP8) |
主机 A 专属 |
综合画质最强,运动自然,ComfyUI 生态好 |
| Wan2.1-1.3B |
1.3B |
≥8GB |
主机 B 可跑 |
轻量版,快速预览与测试 |
| HunyuanVideo |
13B |
≥24GB |
主机 A 专属 |
腾讯出品,中文理解最佳,支持 10s+ 长视频 |
| CogVideoX-5B |
5B |
≥12GB |
主机 B 勉强 |
清华出品,社区 LoRA 丰富,二次元风格好 |
| LTX-Video |
2B |
≥8GB |
两台均可 |
轻量快速,适合快速原型 |
4.2 典型工作流
工作流 A:AI 视频短片生成(主机 A)
文字脚本 → HunyuanVideo/Wan2.1 文生视频 → Topaz Video AI 画质增强 + 插帧
→ DaVinci Resolve 剪辑 + 调色 + 音效 → 成品输出
工作流 B:图生视频 + 动态设计(主机 A)
Stable Diffusion 生成关键帧 → Wan2.1 图生视频
→ ComfyUI 串联 ESRGAN 逐帧增强 → FFmpeg 合成
工作流 C:AnimateDiff 动画短片(主机 B 可参与)
主机 A 生成角色参考 → 主机 B 跑 AnimateDiff 轻量动画
→ ControlNet 姿态控制 → 回合主机 A 增强输出
4.3 视频增强与后期工具
| 工具 |
用途 |
部署位置 |
| Topaz Video AI |
画质修复、超分、帧率插值 |
主机 A |
| DaVinci Resolve (免费版) |
专业剪辑、调色、音效合成 |
主机 A |
| Real-ESRGAN |
开源视频超分+去伪影 |
两台均可 |
| FFmpeg |
格式转换、批量处理、自动化管线 |
两台均可 |
| Deforum (ComfyUI 节点) |
艺术化转场与提示词旅行 |
主机 A |
五、文案创作方向工作流方案
5.1 文案创作模型架构
┌────────────────────────────────────────────────┐
│ 文案创作层 │
│ Ollama API (Qwen2.5-32B / DeepSeek-R1) │
│ 主机 A 主力推理,主机 B 作为备用推理节点 │
├────────────────────────────────────────────────┤
│ RAG 知识库层 │
│ MaxKB / Dify + BGE-M3 嵌入 + Qdrant 向量库 │
│ 主机 B 常驻服务,主机 A 可访问 │
├────────────────────────────────────────────────┤
│ 数据与文档层 │
│ PDF/Word/Excel/Markdown 文档 → 自动向量化 │
└────────────────────────────────────────────────┘
5.2 RAG 知识库方案
| 组件 |
选型 |
部署位置 |
说明 |
| 知识库平台 |
MaxKB |
主机 B |
中文友好,开箱即用,支持 Docker 部署 |
| 备选平台 |
Dify |
主机 B(高级用户) |
支持复杂工作流编排和 Agent |
| 个人知识库 |
AnythingLLM Desktop |
任意一台 |
桌面端,拖拽文件夹即可构建 |
| 嵌入模型 |
BGE-M3 |
主机 B |
多语言向量化,中文效果优异 |
| 向量数据库 |
Qdrant |
主机 B |
高性能,与 MaxKB/Dify 原生集成 |
| 对话前端 |
Open WebUI |
主机 B |
类 ChatGPT 界面,支持 Ollama 后端 |
5.3 典型工作流
工作流 A:长文档深度分析
上传 PDF/Word → MaxKB 自动切片 + BGE-M3 向量化 → Qdrant 存储
→ 用户提问 → RAG 检索 + Qwen2.5-14B(主机 B)生成回答
工作流 B:多语言文案创作
用户提出需求 → 主机 A Ollama (Qwen2.5-32B) 生成初稿
→ 接入 RAG 知识库检索品牌术语/风格指南(主机 B)
→ 融合生成终稿 → 人工校对
工作流 C:批量文档处理与摘要
批量文档 → 主机 B 逐一解析 (Llama-3.1-8B) → 生成摘要
→ 主机 A DeepSeek-R1 综合摘要 + 洞察 → 输出分析报告
5.4 文案效率工具
| 工具 |
用途 |
部署 |
| Open WebUI |
统一对话前端 |
主机 B |
| PageAssist |
浏览器插件,随时唤出 AI |
任意浏览器 |
| Continue.dev |
VS Code / JetBrains AI 代码+文案辅助 |
开发机 |
| Cherry Studio |
桌面 AI 客户端,多模型切换 |
任意一台 |
六、存储规划与资源分配建议
6.1 当前存储状况与风险
| 主机 |
总容量 |
已用 |
剩余 |
风险等级 |
| 主机 A |
4.55TB |
3.65TB |
~900GB |
高危 — 不足以存放模型 + 素材 |
| 主机 B |
5.46TB |
3.95TB |
~1.51TB |
中等 — 需规划模型存放 |
6.2 模型存储预估
| 类别 |
预估占用 |
建议存放位置 |
| 大语言模型 (Ollama) |
200-400GB |
主机 B(常驻服务) |
| Stable Diffusion 模型 |
300-500GB |
主机 A SSD(需高速读取) |
| 视频生成模型 |
100-200GB |
主机 A SSD |
| 向量数据库 |
50-100GB(随文档量增长) |
主机 B |
6.3 存储优化建议
1. 主机 A 紧急清理(剩余仅 900GB,必须立即行动)
- 清理 3 个月未使用的临时文件与缓存
- 将历史项目素材迁移至主机 B 或外置硬盘
- 模型文件仅保留常用版本,旧版归档
- 目标:释放至少 1TB 空间
2. 外置存储扩展
- 建议为主机 A 配备 4TB NVMe 外置 SSD(USB4/Thunderbolt 接口),专用于模型文件
- 主机 B 配备 8TB HDD 用于冷数据归档与备份
3. 分区规划
主机 A SSD:
├── 系统 + 软件:500GB
├── 模型文件:1.5TB(Flux、SDXL、Wan2.1、ControlNet 等)
├── 活跃项目素材:1.5TB
└── 临时缓存:500GB
主机 B SSD:
├── 系统 + 软件:500GB
├── 大语言模型 (Ollama):400GB
├── RAG 服务 + 向量库:200GB
├── 归档项目素材:3TB
└── 备份区:1TB
七、综合部署架构图
┌──────────────────────────────────────────────────────────────────┐
│ 统一入口 │
│ Open WebUI / Cherry Studio / PageAssist 浏览器插件 │
└───────────────┬──────────────────────────────────┬────────────────┘
│ │
┌───────────────▼──────────────┐ ┌────────────────▼────────────────┐
│ 主机 A (主力) │ │ 主机 B (辅助) │
│ i9-13900KF + RTX 4090 24G │ │ i7-12700 + RTX 3080 10G │
│ 64GB DDR5 │ │ 64GB DDR4 │
├───────────────────────────────┤ ├─────────────────────────────────┤
│ │ │ │
│ ▸ 图像生成引擎 │ │ ▸ RAG 知识库服务 │
│ ComfyUI + Flux/SDXL/SUPIR │ │ MaxKB + BGE-M3 + Qdrant │
│ │ │ │
│ ▸ 视频生成引擎 │ │ ▸ 大语言模型服务 (常驻) │
│ Wan2.1 / HunyuanVideo │ │ Ollama: Qwen2.5-14B │
│ │ │ │
│ ▸ 大语言模型 (按需启动) │ │ ▸ 辅助出图服务 │
│ Ollama: Qwen2.5-32B │ │ ComfyUI / SD WebUI Forge │
│ DeepSeek-R1-Distill-70B │ │ SDXL + Flux FP8 │
│ │ │ │
│ ▸ 视频后期 + 剪辑 │ │ ▸ 批量文档处理 │
│ Topaz Video AI │ │ 文档解析 / 摘要 / 翻译 │
│ DaVinci Resolve │ │ │
│ │ │ ▸ 数据存储与备份 │
│ │ │ 归档项目 / 模型冷备份 │
└───────────────────────────────┘ └─────────────────────────────────┘
│ │
└──────────────┬───────────────────┘
│
┌──────────▼──────────┐
│ 共享网络存储 (NAS) │
│ 素材库 / 成品库 / 备份 │
└─────────────────────┘
网络拓扑:
- 两台主机通过 千兆/万兆局域网 互联,实现模型服务共享
- 主机 B 的 Ollama API 和 MaxKB 通过局域网暴露(
http://主机B-IP:11434、http://主机B-IP:8080)
- 主机 A 的 ComfyUI 可通过
--listen 0.0.0.0 参数暴露,供主机 B 远程调用
八、实施事项:
8.1 分阶段实施路线
第一阶段:基础环境搭建(第 1-2 天)
- 主机 A:清理存储空间(目标释放 1TB)
- 两台主机安装 Ollama,拉取核心 LLM 模型
- 主机 A 安装 ComfyUI + 基础模型(Flux FP8、Juggernaut XL)
第二阶段:核心能力部署(第 3-5 天)
- 主机 B 部署 MaxKB + Qdrant + BGE-M3
- 主机 B 接入 Ollama 作为 RAG 后端
- 主机 A 安装 SUPIR、Wan2.1、HunyuanVideo
- 两台 ComfyUI 安装必需插件(Manager、ControlNet、IP-Adapter 等)
第三阶段:工作流打磨(第 6-10 天)
- 搭建 ComfyUI 预设工作流模板(超写实渲染 / IP 一致性 / 视频生成)
- 配置 RAG 知识库,导入常用设计规范、品牌手册、文案模板
- 测试跨主机协作场景(API 调用、模型共享)
第四阶段:优化与培训(第 11-14 天)
- 性能调优(Ollama 并发参数、ComfyUI 启动参数)
- 建立自动化脚本(批量文档处理、视频渲染管线)
- 编写内部使用手册
8.2 日常运行事项:
| 领域 |
注意事项 |
| 散热 |
4090 功耗高达 450W,长时间跑视频生成需确保机箱散热良好;必要时降低功耗墙(nvidia-smi -pl 350) |
| 电源 |
主机 A 建议 1000W 以上金牌电源,确保双满载稳定 |
| 驱动 |
保持 NVIDIA 驱动更新至最新 Game Ready / Studio Driver;CUDA 版本 ≥12.x 以支持 FP8 推理 |
| 显存管理 |
ComfyUI 启动加 --normalvram;跑 Flux/视频模型时监控显存,接近上限时改用 FP8 量化版 |
| 网络安全 |
Ollama API 默认仅监听 127.0.0.1,局域网暴露需加 OLLAMA_HOST=0.0.0.0,建议配合防火墙白名单 |
| 数据隐私 |
所有模型均本地运行,不上传云端;如需联网搜索,走 Dify 的受控联网节点 |
| 备份策略 |
ComfyUI 工作流 JSON、MaxKB 知识库配置每周备份至主机 B;重要项目每日增量备份 |
| 模型许可 |
注意各开源模型的商用许可:Flux 非商用可免费、Llama 3 需接受 Meta 许可协议、DeepSeek MIT 许可宽松 |
8.3 AI性能评估:
| 任务 |
主机 A 预估 |
主机 B 预估 |
| Flux 1024×1024 生成 |
~5-8 秒/张 |
~12-20 秒/张 (FP8) |
| SUPIR 2× 放大 |
~30-60 秒/张 |
不可用 |
| Wan2.1 5 秒视频 |
~5-10 分钟 |
不可用 |
| Qwen2.5-32B 推理 |
~30-40 tokens/s |
不可用(需切换 14B) |
| Qwen2.5-14B 推理 |
~60-80 tokens/s |
~35-45 tokens/s |
| RAG 知识库检索 |
<1 秒(调用主机 B) |
<1 秒(本地) |
附录:推荐资源索引
开源项目
| 项目 |
地址 |
用途 |
| Ollama |
https://ollama.com |
LLM 推理 |
| ComfyUI |
https://github.com/comfyanonymous/ComfyUI |
图像/视频生成 |
| MaxKB |
https://github.com/1Panel-dev/MaxKB |
RAG 知识库 |
| Dify |
https://github.com/langgenius/dify |
AI 应用平台 |
| Open WebUI |
https://github.com/open-webui/open-webui |
对话前端 |
| Wan2.1 |
https://github.com/Wan-Video/Wan2.1 |
视频生成 |
| HunyuanVideo |
https://github.com/Tencent/HunyuanVideo |
视频生成 |
模型下载
| 模型 |
HuggingFace / 下载源 |
| Qwen 2.5 |
https://huggingface.co/Qwen |
| DeepSeek-R1 |
https://huggingface.co/deepseek-ai |
| Flux.1 |
https://huggingface.co/black-forest-labs |
| Juggernaut XL |
https://civitai.com |
| BGE-M3 |
https://huggingface.co/BAAI/bge-m3 |