直接答案
RAG(Retrieval-Augmented Generation,检索增强生成)= 先检索、后生成。用户提问被向量化后,先去向量库里检索最相关的文档块,再把这些内容作为上下文交给大模型生成回答。它让 AI 能使用你的私有知识、最新知识,并让每个答案可溯源,无需重新训练模型。

三个阶段拆解
RAG 系统由两条链路构成,理解它们各自的职责,是排查问题的基础:
| 阶段 | 发生时机 | 关键动作 | 常见故障 |
|---|---|---|---|
| 离线索引 | 文档入库时 | 加载文档 → 清洗 → 分块 → Embedding 向量化 → 写入向量库 | 分块不当、文档过期未更新 |
| 在线检索 | 用户提问时 | 问题向量化 → 相似度检索 Top-K →(可选)重排过滤 | 召回不准、专有名词匹配失败 |
| 受控生成 | 拿到上下文后 | 拼装提示词 → 大模型生成 → 输出带引用的回答 | 上下文超长、模型忽视资料 |
为什么企业需要 RAG
直接调用大模型有三个天然短板:知识停留在训练截止日期、不知道你企业的内部资料、且会"一本正经地编造"。RAG 恰好补齐这三点:资料库可以每天更新;产品手册、政策文件、历史工单都能被检索;回答附带来源,可人工核验。对客服、内部知识助手、行业问答这类场景,RAG 是当前性价比最高的架构。
小结
RAG 的本质是"把大模型当推理引擎,把你的数据当事实来源"。检索质量决定上限,生成质量决定下限。后续文章将分别拆解向量库选型、分块策略、混合检索与效果评估。
常见问题快答
RAG 和普通的大模型对话有什么区别?
普通对话只依赖模型训练时的参数知识,答不了私有与最新信息;RAG 先检索你的资料再生成,答案有出处、可更新、可溯源,是企业落地的标准架构。
搭一套最小可用的 RAG 需要什么?
四个组件:一个 Embedding 模型、一个向量库(pgvector 即可)、一个大模型 API、一段编排代码。用 LangChain 或 LlamaIndex 一天可以跑通原型。
RAG 的最大短板是什么?
检索质量。检索不到正确内容,模型只能硬编或拒答,所以分块、混合检索与 Rerank 才是投入重点。
最后更新于 2026-08-15。本文持续修订,重大更新会标注日期。
