直接答案
RAG 和微调解决的是两类问题:RAG 给模型"外挂知识"(你的产品手册、最新政策),微调改变模型的"行为方式"(输出格式、语气、领域推理习惯)。知识经常变、需要溯源,选 RAG;行为稳定且要求极致、数据够多,选微调;多数企业项目应先 RAG 后微调,两者组合是终极形态。
决策表
| 你的问题 | 推荐 | 原因 |
|---|---|---|
| 模型不知道我们的内部资料 | RAG | 知识外挂,即改即生效 |
| 政策/价格频繁变化 | RAG | 换文档即可,微调跟不上 |
| 回答必须可溯源可审计 | RAG | 天然带引用 |
| 要求固定的 JSON/工单格式 | 微调 | 行为塑造,稳定复现 |
| 特定文风/话术(品牌口吻) | 微调 | 风格是行为不是知识 |
| 领域推理习惯(法律/医学思路) | 微调 | 大量范例才能内化 |
| 既缺知识又要求格式 | RAG+微调 | 知识外挂+行为定制 |
成本视角
RAG 的成本在"持续运维":文档治理、检索优化、评估回归,像运营一个搜索引擎。微调的成本在"数据准备":高质量指令对往往要几千到几万条,标注与清洗是大头,且每次基座模型升级都要重训。对中小团队,RAG 的起步成本通常低一个数量级。
组合策略与顺序
成熟做法是分层:基座模型用通用大模型,领域行为靠微调(可选),事实知识全走 RAG,实时信息(库存、订单)靠工具调用。顺序上先 RAG——它解决 80% 的知识问题且当天可上线;运行三个月后,把高频固定格式的需求沉淀成微调数据集,再做行为微调,此时数据来自真实流量,质量远高于凭空编写。
小结
一句话:知识问题用 RAG,行为问题用微调,预算有限先 RAG。把两者当成对手是误解,它们是栈的不同层。
常见问题快答
微调需要多少条数据?
行为微调(格式、风格)几千条可起步,领域推理类要几万条,且质量比数量重要得多。
RAG 会让回答变慢吗?
会加一次检索延迟(通常 100-300ms),可通过缓存与并发优化,大多数产品场景可接受。
小团队只做一个选哪个?
RAG。见效快、成本可控、可溯源,先跑起来积累数据,微调需求自然浮现。
最后更新于 2026-07-14。本文持续修订,重大更新会标注日期。
