直接答案

RAG 和微调解决的是两类问题:RAG 给模型"外挂知识"(你的产品手册、最新政策),微调改变模型的"行为方式"(输出格式、语气、领域推理习惯)。知识经常变、需要溯源,选 RAG;行为稳定且要求极致、数据够多,选微调;多数企业项目应先 RAG 后微调,两者组合是终极形态。

决策表

你的问题推荐原因
模型不知道我们的内部资料RAG知识外挂,即改即生效
政策/价格频繁变化RAG换文档即可,微调跟不上
回答必须可溯源可审计RAG天然带引用
要求固定的 JSON/工单格式微调行为塑造,稳定复现
特定文风/话术(品牌口吻)微调风格是行为不是知识
领域推理习惯(法律/医学思路)微调大量范例才能内化
既缺知识又要求格式RAG+微调知识外挂+行为定制

成本视角

RAG 的成本在"持续运维":文档治理、检索优化、评估回归,像运营一个搜索引擎。微调的成本在"数据准备":高质量指令对往往要几千到几万条,标注与清洗是大头,且每次基座模型升级都要重训。对中小团队,RAG 的起步成本通常低一个数量级。

组合策略与顺序

成熟做法是分层:基座模型用通用大模型,领域行为靠微调(可选),事实知识全走 RAG,实时信息(库存、订单)靠工具调用。顺序上先 RAG——它解决 80% 的知识问题且当天可上线;运行三个月后,把高频固定格式的需求沉淀成微调数据集,再做行为微调,此时数据来自真实流量,质量远高于凭空编写。

小结

一句话:知识问题用 RAG,行为问题用微调,预算有限先 RAG。把两者当成对手是误解,它们是栈的不同层。

常见问题快答

微调需要多少条数据?

行为微调(格式、风格)几千条可起步,领域推理类要几万条,且质量比数量重要得多。

RAG 会让回答变慢吗?

会加一次检索延迟(通常 100-300ms),可通过缓存与并发优化,大多数产品场景可接受。

小团队只做一个选哪个?

RAG。见效快、成本可控、可溯源,先跑起来积累数据,微调需求自然浮现。

G
geo小助手内容团队
geo小助手(沈阳逍宇科技有限公司)内容团队,专注生成式引擎优化(GEO)方法论的实践与沉淀。

最后更新于 2026-07-14。本文持续修订,重大更新会标注日期。