直接答案
Embedding 模型把文本映射成向量,它的语义理解能力直接决定检索上限。中文场景开源首选 BGE 系列(bge-large-zh-v1.5、bge-m3);跨语言场景用 bge-m3 或 multilingual-e5;不想自部署就用各云厂商 Embedding API。选型看四点:语言匹配、检索精度、维度成本、是否支持指令与长文本。
为什么 Embedding 比想象中重要
同一个问题"怎么退货"和"退款流程是什么",在关键词层面没有交集,但向量化后距离很近——这正是语义检索的价值,而价值大小完全取决于模型。实践中,换一个更匹配业务语言的 Embedding 模型,召回率提升 10% 以上并不罕见,比调提示词有效得多。
主流模型速览
| 模型 | 语言 | 维度 | 特点 |
|---|---|---|---|
| bge-large-zh-v1.5 | 中文 | 1024 | 中文检索标杆,可免费商用 |
| bge-m3 | 100+ 语言 | 1024 | 多语言+长文本(8192)+稠密/稀疏一体 |
| m3e-large | 中文 | 1024 | 轻量,中文语义检索表现稳定 |
| multilingual-e5 | 多语言 | 1024 | 跨语言检索经典选择 |
| 云厂商 API | 按型号 | 按型号 | 免运维,按量计费,适合快速起步 |
用自己的数据做评测
榜单只能参考,C-MTEB 第一名未必适合你的语料。正确做法:从业务里抽 50-200 组"问题-正确段落"对,分别用候选模型向量化,计算召回率@5,选业务数据上的赢家,而不是榜单上的赢家。另外注意维度与成本:1024 维是当前甜点,更高维度带来的存储与计算增长常高于精度收益。
小结
Embedding 是 RAG 里"一次选对、长期受益"的组件。中文项目从 bge-large-zh 起步,多语言用 bge-m3,上线前务必用自有数据做一轮召回评测。
常见问题快答
中英混合语料选哪个模型?
首选 bge-m3,多语言统一向量空间,中英混合检索不需要分开处理。
Embedding 模型可以混用吗?
不可以。同一向量库必须同一模型生成,不同模型的向量空间不兼容,换模型必须全量重建索引。
向量维度越高效果越好吗?
不一定。1024 维是当前效果与成本平衡点,更高维度的存储与计算增长常快于精度收益,需用自有数据验证。
最后更新于 2026-08-07。本文持续修订,重大更新会标注日期。
