直接答案

RAG(Retrieval-Augmented Generation,检索增强生成)= 先检索、后生成。用户提问被向量化后,先去向量库里检索最相关的文档块,再把这些内容作为上下文交给大模型生成回答。它让 AI 能使用你的私有知识、最新知识,并让每个答案可溯源,无需重新训练模型。

RAG 检索增强生成架构示意图:文档分块、向量化、向量数据库检索、大模型生成
RAG 三阶段架构:索引、检索、生成

三个阶段拆解

RAG 系统由两条链路构成,理解它们各自的职责,是排查问题的基础:

阶段发生时机关键动作常见故障
离线索引文档入库时加载文档 → 清洗 → 分块 → Embedding 向量化 → 写入向量库分块不当、文档过期未更新
在线检索用户提问时问题向量化 → 相似度检索 Top-K →(可选)重排过滤召回不准、专有名词匹配失败
受控生成拿到上下文后拼装提示词 → 大模型生成 → 输出带引用的回答上下文超长、模型忽视资料

为什么企业需要 RAG

直接调用大模型有三个天然短板:知识停留在训练截止日期、不知道你企业的内部资料、且会"一本正经地编造"。RAG 恰好补齐这三点:资料库可以每天更新;产品手册、政策文件、历史工单都能被检索;回答附带来源,可人工核验。对客服、内部知识助手、行业问答这类场景,RAG 是当前性价比最高的架构。

小结

RAG 的本质是"把大模型当推理引擎,把你的数据当事实来源"。检索质量决定上限,生成质量决定下限。后续文章将分别拆解向量库选型、分块策略、混合检索与效果评估。

常见问题快答

RAG 和普通的大模型对话有什么区别?

普通对话只依赖模型训练时的参数知识,答不了私有与最新信息;RAG 先检索你的资料再生成,答案有出处、可更新、可溯源,是企业落地的标准架构。

搭一套最小可用的 RAG 需要什么?

四个组件:一个 Embedding 模型、一个向量库(pgvector 即可)、一个大模型 API、一段编排代码。用 LangChain 或 LlamaIndex 一天可以跑通原型。

RAG 的最大短板是什么?

检索质量。检索不到正确内容,模型只能硬编或拒答,所以分块、混合检索与 Rerank 才是投入重点。

G
geo小助手内容团队
geo小助手(沈阳逍宇科技有限公司)内容团队,专注生成式引擎优化(GEO)方法论的实践与沉淀。

最后更新于 2026-08-15。本文持续修订,重大更新会标注日期。