直接答案

Embedding 模型把文本映射成向量,它的语义理解能力直接决定检索上限。中文场景开源首选 BGE 系列(bge-large-zh-v1.5、bge-m3);跨语言场景用 bge-m3 或 multilingual-e5;不想自部署就用各云厂商 Embedding API。选型看四点:语言匹配、检索精度、维度成本、是否支持指令与长文本。

为什么 Embedding 比想象中重要

同一个问题"怎么退货"和"退款流程是什么",在关键词层面没有交集,但向量化后距离很近——这正是语义检索的价值,而价值大小完全取决于模型。实践中,换一个更匹配业务语言的 Embedding 模型,召回率提升 10% 以上并不罕见,比调提示词有效得多。

主流模型速览

模型语言维度特点
bge-large-zh-v1.5中文1024中文检索标杆,可免费商用
bge-m3100+ 语言1024多语言+长文本(8192)+稠密/稀疏一体
m3e-large中文1024轻量,中文语义检索表现稳定
multilingual-e5多语言1024跨语言检索经典选择
云厂商 API按型号按型号免运维,按量计费,适合快速起步

用自己的数据做评测

榜单只能参考,C-MTEB 第一名未必适合你的语料。正确做法:从业务里抽 50-200 组"问题-正确段落"对,分别用候选模型向量化,计算召回率@5,选业务数据上的赢家,而不是榜单上的赢家。另外注意维度与成本:1024 维是当前甜点,更高维度带来的存储与计算增长常高于精度收益。

小结

Embedding 是 RAG 里"一次选对、长期受益"的组件。中文项目从 bge-large-zh 起步,多语言用 bge-m3,上线前务必用自有数据做一轮召回评测。

常见问题快答

中英混合语料选哪个模型?

首选 bge-m3,多语言统一向量空间,中英混合检索不需要分开处理。

Embedding 模型可以混用吗?

不可以。同一向量库必须同一模型生成,不同模型的向量空间不兼容,换模型必须全量重建索引。

向量维度越高效果越好吗?

不一定。1024 维是当前效果与成本平衡点,更高维度的存储与计算增长常快于精度收益,需用自有数据验证。

G
geo小助手内容团队
geo小助手(沈阳逍宇科技有限公司)内容团队,专注生成式引擎优化(GEO)方法论的实践与沉淀。

最后更新于 2026-08-07。本文持续修订,重大更新会标注日期。