交流会上讨论知识库建设,一位公职律师同行说了一句话,我回去想了很久:
“如果你没有数据库,你反而不会出问题。”
乍听是反话。他的意思是:没有数据库,你会老老实实现查;有了数据库,你就依赖它——它错了,你不知道;它过期了,你也不知道。
甜区和苦区
同一场会上,有另一个对照组。
一位承担生态环境法典普法任务的同行,建了自己的知识库:法典文本、各律所的公众号文章、人大网站上的记者采访,一共 120 多篇,不大。她的用法很明确:给企业家、政府部门、群众做普法 PPT。现在的效果是,20 页以上的 PPT 出来基本不用改,每次成本一百块以内。
小而专的库,是甜的。
那位公职律师同行建过另一个库:汽车核心技术领域,什么都往里放。后来库越来越庞大,庞大到分类都救不了;再往后,读取都变得困难,查一次特别耗时间。
大而全的库,是苦的。
甜区和苦区的分界,不在技术,在维护。而维护里最难的环节是清理,不是新增。
信任是风险放大器
知识库的三个困境,都是真话。
第一个,抽取的准确性。你把判决书、法条抽成要点存进库里,抽取的那一下就可能出错。法官对同一个法条的解读都不一样,你凭什么保证 AI 抽出来的要素是准的?
第二个,失效。法规在修订,司法解释在更新,库里的旧内容不会自己举旗报告“我过期了”。库越大,沉默的失效越多。
第三个,也是最隐蔽的:信任本身。库越好用,你越信它;你越信它,它错的那一次就越深。没有库的时候你现查,错处在明面上;有了库你调用,错处夹在看起来都很正确的结果里。
所以那位同行的话不是反话,是忠告。知识库的价值和它的风险,是同一种东西喂大的。
我现在的做法(说诚实的版本)
被问到这个问题时,我给的答案我自己也只满意一半。
我的本机知识库,元信息只抽很窄的一层:法规名称、颁布和生效时间、当前效力状态,最多再加一层索引——某个概念在哪几部法的哪几个条款里出现过。条款的具体规则不抽,抽了就容易错,错了你也不知道。
真正用到的时候,调完知识库产生的内容,再通过商用数据库的接口核一遍:这次引用的几个法条,和权威库里的原文一不一致。
第三个做法和工作区有关。我同一类案件都在同一个工作区里做,历史记忆文件每次都会被重新读取,新案件是在上一次工作的基础面上继续的。哪个法官有什么特点,交互中形成了记忆,下一次同类工作自然就带上。这个办法不依赖一次性的准确抽取,依赖的是持续迭代。
还有一个反向预警:我的库里有大量实务文章。重要的新法一颁布,那几个公众号一定会有大批解读文章,有些还会盘点这个领域法规的变化。文章库的更新,反过来提醒我哪些法规库该核查了。
没想明白的部分
有两件事我到现在没有好办法,说出来以免你以为我都解决了。
一是失效清理。库里哪些内容已经从有效变成失效、哪些被修订过,靠人工盘不过来,我还没有找到可靠的机制。
二是自动化比对的基准。有同行建议做一个自动化项目,每月把库和权威来源比对一次。方向对,但比较基准是谁?国家法律法规库的覆盖面不够全,商用数据库要谈接口和成本。这个问题不解决,自动化比对就跑不起来。
知识库运营里没有银弹。能做的是在关键环节装门禁,把信任分成等级:核过的,放心用;没核过的,标记出来小心用。
最后:甜区不靠运气,靠修剪
我越来越觉得,知识库这个东西像案卷柜:卷放进去的时候都是有效的,难的是你知不知道哪一卷该撤了。
所以“用得越多,越要怀疑”不是劝你别建库。是劝你建库的时候,把门禁一起建上。
作者简介: 陈石律师,浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。四明山法师 AI 夜校(legalAGI.cn)发起人。