跳到主内容
← 全部笔记

Note 03

硬事实不进向量库 —— 三层知识库的由来

向量检索找的是「相似」。而型号 A 和型号 B 的参数表,在向量空间里挨得非常近。

设计销售询盘问答方案时,最先想到的做法是把所有资料一股脑灌进向量库:产品手册、参数表、历史问答、报价单。检索出来喂给模型,让它回答。

统一放进向量库便于组织问答流程,但存在型号混淆风险。向量检索寻找语义相近的片段,而同系列型号的参数表往往描述相似、参数不同。如果为 A 型号的问题召回了 B 型号的资料,生成的答复就可能引用错误参数;这也是方案需要后续评测的风险。

客户拿着这个参数去下单,货到了对不上,这件事的成本不是"回答质量下降",是退货和信任。

所以拆成了三层。型号、参数、认证这类硬事实走结构化精确匹配 —— 查得到就返回,查不到就说查不到,不进向量检索。产品说明、应用场景这类本来就模糊的内容才走向量。历史问答单独一层,用来对齐口径和语气。

方案的代价是覆盖范围受已有资料限制,查不到的问题需要转人工确认。系统仍在建设中,是否减少核对成本、销售是否采用,需要通过后续评测与实际使用验证。