三种模式详解
离线 / 在线 / 并行——什么时候用哪个、它们各自的优劣。
一句话理解
| 模式 | 谁回答 | 隐私 | 能力 | 需要联网 |
|---|---|---|---|---|
| 离线 | 你电脑上的模型 | 离线模式:本地推理 | 取决于本地模型 | ❌ 不需要 |
| 在线 | 云端大模型 | 在线模式:提问发云端 | 取决于云端模型 | ✅ 需要 |
| 并行 | 本地+云端协作 | 并行模式:KB 本地,问答混合 | 取决于本地 + 云端模型 | ✅ 需要 |
🔌 离线模式
所有事都在你电脑里完成。聊天、文档生成、工具调用——不联网也能用。
什么时候用
- 没信号、坐飞机、担心隐私时
- 日常闲聊、写作、简单任务
- 想完全掌控数据
能做什么 / 不能做什么
- ✅ 聊天、写作、翻译、总结
- ✅ 本地知识库问答
- ✅ 文档生成(.docx)
- ⚠️ 工具调用只在在线 / 并行模式下可用(search_web / fetch_url / write_workspace / read_workspace / calculator / search_kb 等)。离线模式不调工具(保持纯本地推理)。
- ❌ 联网搜索(search_web)
- ❌ 读网页(fetch_url)
硬件要求
模型按内存选档:16GB→0.8B / 24GB→2B / 32GB→4B(有独显更快,没有也能跑)。
☁️ 在线模式
用云端大模型回答你的问题。你电脑只负责发问 + 收答案,本地不跑模型。
什么时候用
- 需要更强的能力(复杂推理、长文)
- 本机跑不动大模型
- 用 DeepSeek / GPT-4 / 通义千问 这些云端模型
能做什么
- 所有云端大模型的能力(取决于你选哪个模型)
- 联网搜索、读网页(云端做)
- 支持 OpenAI 兼容 API(OpenAI / DeepSeek / 通义 / GLM / 自建)
不想发出去的内容不要发——比如你公司机密、还没发布的代码。
⚡ 并行模式
本地知识库 + 云端大模型双线协作。本地侧用本地模型 + 本地 KB 检索做回答;云端侧同时调第三方云端模型独立回答;最后由本地模型综合两路信息,融合输出最终回答。
工作流(3 个阶段,2 步输出)
- 阶段 1 · 双流并行:你提问后,Sidemate 同时启动两路——
· 本地路:在本地知识库检索相关内容(不出本机)
· 云端路:把你的原始问题发给云端做补充视角 - 阶段 2 · 融合输出:本地模型综合本地检索与云端视角,融合输出最终回答(本地和云端两段内容先后出现)
什么时候用
- 有一堆资料(公司文档、论文、笔记),想问"这些资料里讲了什么"
- 需要本地隐私保护 + 云端能力的组合
- 想看 AI 是怎么回答的(透明可查)
隐私保证
- ✅ 知识库内容:本地推理 + 本地存储(embedding / reranker 均在本地)
- ✅ 知识库检索段落:不出本机(本地侧用 KB 检索 + 本地模型生成答案,云端侧只看到你的提问原文)
- ⚠️ 你的提问:发给云端
- ⚠️ 云端的回答:返回本地后由本地模型融合最终输出
怎么切换模式?
在聊天页顶部标题栏右侧,三段模式按钮(离线 / 在线 / 并行)切换。
切换时会弹一个确认框,告诉你这个模式的特点和数据归属。
推荐场景速查
| 场景 | 推荐模式 |
|---|---|
| 日常聊天、写邮件 | 离线 |
| 查资料(本地) | 离线 |
| 复杂推理、长文 | 在线 |
| 联网搜最新信息 | 在线 |
| 查公司文档(隐私) | 并行(先本地检索) |
| 读 PDF / Word 总结 | 离线 |
| 跑命令 / 读文件 / 写文档(工具调用) | 在线 |
| 做调研报告 | 在线 |
下一步
想知道具体的"怎么用":