攒知识库的人,很容易掉进同一个执念:大。
法规要全,案例要多,文章要广,几十个 G 的资料躺在硬盘里才有安全感。我自己的法律知识库也经历过这个阶段。但用下来越久越确信一个反直觉的结论:对 AI 检索来说,更小的库,反而更有价值。库的质量和它的规模,经常是负相关的。
先看一个具体问题
“夫妻共同财产到底是怎么规定的?”
这个问题你会怎么查?让 AI 在你整个知识库里检索——所有法规、全部书籍、案例、文章,几十万份文件一起搜;还是把它放进三个库里查:《民法典理解与适用》、《民事审判指导与参考》,再加一个民事类案例库?
直觉上说前者更全,毕竟是“全部资料”。实际效果恰恰相反。那三本书加案例库,边界清晰,搜出来的每一条都在射程之内,权重排序更容易把你要的东西顶到前面。而在全库里搜,形式书籍、随笔文章里出现的“夫妻共同财产”字样全都会涌进来——那些命中对你没有任何用处,却会把真正要紧的内容挤出前排。
全库包含小库,但小库的效果一定更好。这句话值得每个攒库的人记住。
机制:AI 检索不是通读
为什么会出现“更全反而更差”?得从 AI 查资料的真实方式说起。
很多人以为,给 AI 一个知识库,它会把库里相关的内容全部读一遍再回答。不会的。真实过程是:AI 把你的问题提炼成关键词,去库里做检索,召回一批候选片段,按相关性排序,然后只取排在最前面的若干条——上下文装不下那么多,它取够了就认为“信息充分”,开始作答。
这个机制下,库越大,坑越深。关键词宽一点,命中的候选就成千上万,截断丢弃的是绝大多数;而模型“认为够了”的那几十条,可能跟你要的裁判方向毫无关系。检索失败的根源,常常不是库里没有,而是库里太多。
还有一个没处说理的地方:每一轮检索返回多少条,模型才觉得“够了”,不同产品设定不同,也不会向你报告。你只能在用的过程中去感受——同一类问题多问几次,看它引用的资料覆盖不覆盖你的预期。
怎么把库“变小”
说清楚机制,方法就顺出来了。核心动作叫收敛,我有三个惯用做法。
第一,重要问题手动圈范围。别把整个库丢给它。像前面的例子,明确指令:只在理解与适用、审判指导这两套书加民事案例库里检索。范围一圈,信噪比立刻上去。越是重要的问题,越要舍得放弃“全库搜索”的心理安慰。
第二,关键词分轮次给足。一个问题拆成几轮检索,每轮给出明确的关键词组合,别指望它一次提炼到位。宽泛词先收敛成规范术语,再补充同义词和上下位概念。你多写一行检索要求,它少丢一堆相关资料。
第三,多开几个 agent 并行查。每个 agent 拿到同一个问题,提炼的初始关键词都不一样,等于自动帮你做了多路检索。分头查完汇总,查全率明显好过单路。这是用算力换召回率,划算。
组织库的时候,就按“小”来设计
上面三招是检索时的动作。更根本的,是建库时就把结构设计成方便收敛的形态。
按问题域分库,而不是堆成一座大山。理解与适用、建工案例、税务问答,各自成库,用时下钻。宁要十个各司其职的小库,不要一个什么都装的大库。
失效内容是“大而乱”的最大来源,要重点治理。一个庞大但效力标签管理得乱七八糟的库,跟一个规模不大但标签准确的库放在一起,后者价值更高——法规库的价值密度和体量经常成反比。定期清失效、标注效力,比不断往里堆新材料更重要。
另外留一层索引:给每个小库配一页说明,写清这个库收什么、不收什么、权威程度如何。索引本身是给 AI 看的路标,也是给你自己看的家底清单。
边界:不是让你删库
最后澄清一句,“更小的库更有价值”说的不是把大库删掉,而是组织方式:大库做底层储备,检索时按问题下钻到小库。资料该攒还是攒,只是别指望“大”本身带来好答案。
检索质量由边界决定,不由存量决定。下一次检索结果不理想,先别怀疑库里缺资料——很可能恰恰相反,是它太多了。
作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。