双机本地模型办公方案

双机本地模型办公方案

基于两台主机的配置评估与本地 AI 工作流方案,涵盖设计、视频、文案三大方向。

一、两台主机配置对比分析

1.1 基础配置一览

配置项 主机 A (主力机) 主机 B (辅助机)
CPU i9-13900KF,24核32线程,3.0GHz 基础 i7-12700,12核20线程,2.10GHz
内存 64GB DDR5 64GB DDR4 2400MT/s
显卡 RTX 4090 24GB 显存 RTX 3080 10GB 显存
硬盘 4.55TB 总量,已用 3.65TB(剩余 ~900GB) 5.46TB 总量,已用 3.95TB(剩余 ~1.51TB)

1.2 各维度评分对比

评估维度 主机 A 主机 B 说明
大模型推理能力 10/10 7/10 4090 的 24GB 显存可流畅运行 Qwen2.5-72B(Q4 量化)、Llama-3.3-70B 等顶级模型;3080 的 10GB 仅适合 7B~14B 级别
图像生成能力 10/10 8/10 4090 可跑 Flux.1-dev FP16 满血版 + SUPIR 4K 放大;3080 跑 SDXL 和 Flux FP8 仍胜任
视频生成能力 10/10 5/10 4090 可运行 Wan2.1-14B、HunyuanVideo 等视频模型;10GB 显存几乎无法本地跑视频生成大模型
多任务并行 9/10 8/10 主机 A 的 CPU 核心数更高,但两台均为 64GB 内存,均可多服务并行
存储空间 5/10 6/10 主机 A 剩余仅约 900GB,严重不足;主机 B 剩余约 1.51TB,略有余量
综合评分 9.3/10 6.8/10 主机 A 为绝对主力;主机 B 适合辅佐、知识库、批量处理等非实时任务

1.3 角色定位


二、本地大模型选型推荐

2.1 主机 A 适用模型(24GB 显存)

模型名称 参数量 推荐量化 显存占用 适用场景
Qwen2.5-72B-Instruct 72B Q4_K_M ~40GB(部分 offload 内存) 综合中文文案、深度分析
Llama-3.3-70B-Instruct 70B Q4_K_M ~40GB 英文创作、通用推理
DeepSeek-R1-Distill-Llama-70B 70B Q4_K_M ~40GB 强推理任务、复杂逻辑分析
Qwen2.5-32B-Instruct 32B Q5_K_M ~22GB(全 GPU) 日常文案主力,速度与质量平衡
DeepSeek-Coder-V2-Instruct 16B/236B Q4_K_M (16B) ~10GB 代码辅助
Qwen2.5-14B-Instruct 14B Q8 ~14GB 轻量快速响应

推荐策略:日常文案用 Qwen2.5-32B(全 GPU 加载,速度快);重度推理切换到 DeepSeek-R1-Distill(部分 offload 至 64GB 内存)。

2.2 主机 B 适用模型(10GB 显存)

模型名称 参数量 推荐量化 显存占用 适用场景
Qwen2.5-14B-Instruct 14B Q4_K_M ~8GB 中文对话、知识库问答
Llama-3.1-8B-Instruct 8B Q8 ~8GB 英文文案、快速对话
DeepSeek-R1-Distill-Qwen-7B 7B Q5_K_M ~6GB 推理辅助
Phi-4-14B 14B Q4_K_M ~8GB 逻辑分析(微软出品,小参数高智商)
nomic-embed-text 0.14B ~0.3GB 文本向量化(RAG 嵌入模型)
BGE-M3 0.5B ~1GB 多语言中文向量化

推荐策略:主机 B 部署 Qwen2.5-14B 作为 RAG 知识库后端,辅以 BGE-M3 嵌入模型。

2.3 推理框架选型

框架 适用机型 特点
Ollama 两台均适用 命令行一键部署,REST API 原生支持,生态最丰富
LM Studio 推荐主机 B GUI 图形界面,零代码操作,适合非技术场景
vLLM 主机 A(高级用户) 高吞吐推理引擎,适合生产级 API 服务
llama.cpp 两台均适用 底层推理库,Ollama 底层即基于此

三、设计方向工作流方案

3.1 图像生成平台

平台 适用主机 说明
ComfyUI 主机 A(主力)/ 主机 B(辅助) 节点式工作流,灵活度最高,2025 行业标准
Stable Diffusion WebUI (Forge) 主机 B 对显存优化好,适合 10GB 显卡,操作直观

3.2 推荐模型清单

主机 A (RTX 4090) — 设计模型

模型 类型 适用场景
Flux.1-dev 基础大模型 超写实渲染、文字海报、商业设计(FP16 满血可跑)
Juggernaut XL V11 SDXL 微调 商业级写实人像与场景
Animagine XL V3.1 SDXL 微调 二次元角色设计
SD3.5-Medium DiT 架构 提示词遵从度高,构图能力强

主机 B (RTX 3080) — 设计模型

模型 类型 适用场景
Flux.1-dev FP8 量化大模型 基础设计出图
Juggernaut XL SDXL 写实类生成
DreamShaper XL SDXL 艺术风格、概念设计

3.3 典型工作流

工作流 A:超写实商业渲染(主机 A 专属)

线稿/草图 → ControlNet Canny/Depth → SDXL/Flux 生成 1024×1024
    → SUPIR 4K 放大修复 → Adobe Lightroom 后期调色

SUPIR 是当前最强 AI 放大模型,需 24GB 显存,主机 A 独占运行。

工作流 B:IP 一致性系列设计(两台协作)

角色参考图 → IP-Adapter FaceID(主机 A)→ 批量生成不同场景
    → 主机 B 批量 Inpaint 修正 → Figma/PS 排版输出

工作流 C:创意海报(含文字)

提示词(含完整文字内容)→ Flux.1-dev(主机 A)
    → ControlNet QR Code Monster 创意融合 → 4K 输出

3.4 关键插件与工具

工具/插件 用途 部署位置
ComfyUI-Manager 插件管理 两台均装
IP-Adapter 角色/风格一致性 主机 A
ControlNet(Canny/Depth/QRCode) 构图控制 两台均装
SUPIR 4K 超分放大 主机 A 专属
Topaz Gigapixel AI 商业级放大备选 主机 A
Upscayl 免费开源放大 主机 B

四、视频处理方向工作流方案

4.1 视频生成模型选型

模型 参数量 显存需求 部署位置 特点
Wan2.1-14B 14B ≥24GB (FP8) 主机 A 专属 综合画质最强,运动自然,ComfyUI 生态好
Wan2.1-1.3B 1.3B ≥8GB 主机 B 可跑 轻量版,快速预览与测试
HunyuanVideo 13B ≥24GB 主机 A 专属 腾讯出品,中文理解最佳,支持 10s+ 长视频
CogVideoX-5B 5B ≥12GB 主机 B 勉强 清华出品,社区 LoRA 丰富,二次元风格好
LTX-Video 2B ≥8GB 两台均可 轻量快速,适合快速原型

4.2 典型工作流

工作流 A:AI 视频短片生成(主机 A)

文字脚本 → HunyuanVideo/Wan2.1 文生视频 → Topaz Video AI 画质增强 + 插帧
    → DaVinci Resolve 剪辑 + 调色 + 音效 → 成品输出

工作流 B:图生视频 + 动态设计(主机 A)

Stable Diffusion 生成关键帧 → Wan2.1 图生视频
    → ComfyUI 串联 ESRGAN 逐帧增强 → FFmpeg 合成

工作流 C:AnimateDiff 动画短片(主机 B 可参与)

主机 A 生成角色参考 → 主机 B 跑 AnimateDiff 轻量动画
    → ControlNet 姿态控制 → 回合主机 A 增强输出

4.3 视频增强与后期工具

工具 用途 部署位置
Topaz Video AI 画质修复、超分、帧率插值 主机 A
DaVinci Resolve (免费版) 专业剪辑、调色、音效合成 主机 A
Real-ESRGAN 开源视频超分+去伪影 两台均可
FFmpeg 格式转换、批量处理、自动化管线 两台均可
Deforum (ComfyUI 节点) 艺术化转场与提示词旅行 主机 A

五、文案创作方向工作流方案

5.1 文案创作模型架构

┌────────────────────────────────────────────────┐
│                  文案创作层                      │
│  Ollama API (Qwen2.5-32B / DeepSeek-R1)        │
│  主机 A 主力推理,主机 B 作为备用推理节点          │
├────────────────────────────────────────────────┤
│               RAG 知识库层                        │
│  MaxKB / Dify + BGE-M3 嵌入 + Qdrant 向量库     │
│  主机 B 常驻服务,主机 A 可访问                   │
├────────────────────────────────────────────────┤
│                数据与文档层                       │
│  PDF/Word/Excel/Markdown 文档 → 自动向量化        │
└────────────────────────────────────────────────┘

5.2 RAG 知识库方案

组件 选型 部署位置 说明
知识库平台 MaxKB 主机 B 中文友好,开箱即用,支持 Docker 部署
备选平台 Dify 主机 B(高级用户) 支持复杂工作流编排和 Agent
个人知识库 AnythingLLM Desktop 任意一台 桌面端,拖拽文件夹即可构建
嵌入模型 BGE-M3 主机 B 多语言向量化,中文效果优异
向量数据库 Qdrant 主机 B 高性能,与 MaxKB/Dify 原生集成
对话前端 Open WebUI 主机 B 类 ChatGPT 界面,支持 Ollama 后端

5.3 典型工作流

工作流 A:长文档深度分析

上传 PDF/Word → MaxKB 自动切片 + BGE-M3 向量化 → Qdrant 存储
    → 用户提问 → RAG 检索 + Qwen2.5-14B(主机 B)生成回答

工作流 B:多语言文案创作

用户提出需求 → 主机 A Ollama (Qwen2.5-32B) 生成初稿
    → 接入 RAG 知识库检索品牌术语/风格指南(主机 B)
    → 融合生成终稿 → 人工校对

工作流 C:批量文档处理与摘要

批量文档 → 主机 B 逐一解析 (Llama-3.1-8B) → 生成摘要
    → 主机 A DeepSeek-R1 综合摘要 + 洞察 → 输出分析报告

5.4 文案效率工具

工具 用途 部署
Open WebUI 统一对话前端 主机 B
PageAssist 浏览器插件,随时唤出 AI 任意浏览器
Continue.dev VS Code / JetBrains AI 代码+文案辅助 开发机
Cherry Studio 桌面 AI 客户端,多模型切换 任意一台

六、存储规划与资源分配建议

6.1 当前存储状况与风险

主机 总容量 已用 剩余 风险等级
主机 A 4.55TB 3.65TB ~900GB 高危 — 不足以存放模型 + 素材
主机 B 5.46TB 3.95TB ~1.51TB 中等 — 需规划模型存放

6.2 模型存储预估

类别 预估占用 建议存放位置
大语言模型 (Ollama) 200-400GB 主机 B(常驻服务)
Stable Diffusion 模型 300-500GB 主机 A SSD(需高速读取)
视频生成模型 100-200GB 主机 A SSD
向量数据库 50-100GB(随文档量增长) 主机 B

6.3 存储优化建议

1. 主机 A 紧急清理(剩余仅 900GB,必须立即行动) - 清理 3 个月未使用的临时文件与缓存 - 将历史项目素材迁移至主机 B 或外置硬盘 - 模型文件仅保留常用版本,旧版归档 - 目标:释放至少 1TB 空间

2. 外置存储扩展 - 建议为主机 A 配备 4TB NVMe 外置 SSD(USB4/Thunderbolt 接口),专用于模型文件 - 主机 B 配备 8TB HDD 用于冷数据归档与备份

3. 分区规划

主机 A SSD:
  ├── 系统 + 软件:500GB
  ├── 模型文件:1.5TB(Flux、SDXL、Wan2.1、ControlNet 等)
  ├── 活跃项目素材:1.5TB
  └── 临时缓存:500GB

主机 B SSD:
  ├── 系统 + 软件:500GB
  ├── 大语言模型 (Ollama):400GB
  ├── RAG 服务 + 向量库:200GB
  ├── 归档项目素材:3TB
  └── 备份区:1TB

七、综合部署架构图

┌──────────────────────────────────────────────────────────────────┐
│                          统一入口                                 │
│          Open WebUI / Cherry Studio / PageAssist 浏览器插件        │
└───────────────┬──────────────────────────────────┬────────────────┘
                │                                  │
┌───────────────▼──────────────┐  ┌────────────────▼────────────────┐
│         主机 A (主力)          │  │         主机 B (辅助)            │
│  i9-13900KF + RTX 4090 24G   │  │   i7-12700 + RTX 3080 10G        │
│  64GB DDR5                    │  │   64GB DDR4                     │
├───────────────────────────────┤  ├─────────────────────────────────┤
│                               │  │                                 │
│  ▸ 图像生成引擎                │  │  ▸ RAG 知识库服务                 │
│    ComfyUI + Flux/SDXL/SUPIR  │  │    MaxKB + BGE-M3 + Qdrant      │
│                               │  │                                 │
│  ▸ 视频生成引擎                │  │  ▸ 大语言模型服务 (常驻)           │
│    Wan2.1 / HunyuanVideo      │  │    Ollama: Qwen2.5-14B          │
│                               │  │                                 │
│  ▸ 大语言模型 (按需启动)        │  │  ▸ 辅助出图服务                   │
│    Ollama: Qwen2.5-32B        │  │    ComfyUI / SD WebUI Forge     │
│    DeepSeek-R1-Distill-70B    │  │    SDXL + Flux FP8              │
│                               │  │                                 │
│  ▸ 视频后期 + 剪辑              │  │  ▸ 批量文档处理                  │
│    Topaz Video AI             │  │    文档解析 / 摘要 / 翻译         │
│    DaVinci Resolve            │  │                                 │
│                               │  │  ▸ 数据存储与备份                 │
│                               │  │    归档项目 / 模型冷备份           │
└───────────────────────────────┘  └─────────────────────────────────┘
                │                                  │
                └──────────────┬───────────────────┘
                               │
                    ┌──────────▼──────────┐
                    │   共享网络存储 (NAS)   │
                    │   素材库 / 成品库 / 备份  │
                    └─────────────────────┘

网络拓扑:


八、实施事项:

8.1 分阶段实施路线

第一阶段:基础环境搭建(第 1-2 天)

第二阶段:核心能力部署(第 3-5 天)

第三阶段:工作流打磨(第 6-10 天)

第四阶段:优化与培训(第 11-14 天)

8.2 日常运行事项:

领域 注意事项
散热 4090 功耗高达 450W,长时间跑视频生成需确保机箱散热良好;必要时降低功耗墙(nvidia-smi -pl 350
电源 主机 A 建议 1000W 以上金牌电源,确保双满载稳定
驱动 保持 NVIDIA 驱动更新至最新 Game Ready / Studio Driver;CUDA 版本 ≥12.x 以支持 FP8 推理
显存管理 ComfyUI 启动加 --normalvram;跑 Flux/视频模型时监控显存,接近上限时改用 FP8 量化版
网络安全 Ollama API 默认仅监听 127.0.0.1,局域网暴露需加 OLLAMA_HOST=0.0.0.0,建议配合防火墙白名单
数据隐私 所有模型均本地运行,不上传云端;如需联网搜索,走 Dify 的受控联网节点
备份策略 ComfyUI 工作流 JSON、MaxKB 知识库配置每周备份至主机 B;重要项目每日增量备份
模型许可 注意各开源模型的商用许可:Flux 非商用可免费、Llama 3 需接受 Meta 许可协议、DeepSeek MIT 许可宽松

8.3 AI性能评估:

任务 主机 A 预估 主机 B 预估
Flux 1024×1024 生成 ~5-8 秒/张 ~12-20 秒/张 (FP8)
SUPIR 2× 放大 ~30-60 秒/张 不可用
Wan2.1 5 秒视频 ~5-10 分钟 不可用
Qwen2.5-32B 推理 ~30-40 tokens/s 不可用(需切换 14B)
Qwen2.5-14B 推理 ~60-80 tokens/s ~35-45 tokens/s
RAG 知识库检索 <1 秒(调用主机 B) <1 秒(本地)

附录:推荐资源索引

开源项目

项目 地址 用途
Ollama https://ollama.com LLM 推理
ComfyUI https://github.com/comfyanonymous/ComfyUI 图像/视频生成
MaxKB https://github.com/1Panel-dev/MaxKB RAG 知识库
Dify https://github.com/langgenius/dify AI 应用平台
Open WebUI https://github.com/open-webui/open-webui 对话前端
Wan2.1 https://github.com/Wan-Video/Wan2.1 视频生成
HunyuanVideo https://github.com/Tencent/HunyuanVideo 视频生成

模型下载

模型 HuggingFace / 下载源
Qwen 2.5 https://huggingface.co/Qwen
DeepSeek-R1 https://huggingface.co/deepseek-ai
Flux.1 https://huggingface.co/black-forest-labs
Juggernaut XL https://civitai.com
BGE-M3 https://huggingface.co/BAAI/bge-m3