这两年跟同行聊 AI,我发现一个有意思的现象:观点尖锐对立的两群人,脑子里装着同一套归因逻辑。
一群人是模型发烧友。新模型发布必实测,跑分如数家珍,聊天三句离不开“等你试试最新的那个”。另一群人恰好相反,试过一两次,判定“不行,替代不了律师”,从此挂起免战牌。方向相反,但你去追问他们的理由,会发现是同一句话的两种读法:产出好不好,取决于模型行不行。
一边在等模型变行,一边在等模型已经不行。模型成了唯一被讨论的变量。
我的看法不一样,直接说结论:你手上 AI 产出的质量问题,最不可能是模型智能不够。
一个公式
把现在能干活的那类 AI 拆开看,它等于两个东西相加:模型,加 Harness。
Harness 是个工程圈的词,本义是套马的马具,引申为驾驭一套系统所需的全部装备。放到 AI 语境里,指的是模型之外、决定产出质量的所有东西:你喂给它什么数据,你给它立了什么规矩,你的工作是怎么组织的,出错之后怎么纠正、纠正的结果有没有被留下来。
这个公式为什么重要?因为它改变了归因。产出不好,可能性按概率排:最常见的是数据问题,该给它看的材料它没看到,或者看到的是脏的;其次是规则问题,你没告诉它边界在哪、标准是什么,它按自己的默认理解自由发挥;再次是交互问题,任务交代得含混,或者干到一半上下文丢了。模型智能不够排在这些后面,远远地排在后面。
不是模型没有差距。模型当然有代际,有强弱。但今天主流模型的能力,对绝大多数专业任务来说已经过了够用的门槛。你感受到的天花板,十有八九不是模型的天花板,是你这套驾驭装备的天花板。
同一个模型,十种水平
不信的话做个简单实验。找十个律师,发同一个模型,布置同一件事:把一份卷宗的材料做一遍初筛。
有人把 PDF 一股脑拖进去,说“帮我分析”。有人先转成干净的文本,材料按类别放好,写清楚先看什么后看什么、什么样的疑点要标出来、拿不准的单独列。这两个人的产出摆在一起,你会以为背后是两个不同档次的产品。不是。同一个模型。差别全在马具上。
我自己有一个更极端的样本。证据分析这件事,我用裸的对话界面做,跟用配好规则和管线的工作区做,产出质量差出一个档次。裸用时它会自信地把灰度印章统计成红章、把剪辑过的音频当完整录音处理,因为没人告诉它这些地方要停;配好规则之后,同样的模型,在同样的坑前面会停下来问我。模型没变,变的是它被告知了什么。
这里有个容易被忽略的机制:AI 的产出永远看起来逻辑清晰、表达通畅、信心十足,哪怕内容是错的。用原来判断人的专业性的方法去判断它的专业性,就会出问题。人话讲得漂亮,通常意味着真懂;它话讲得漂亮,只意味着语言能力强。所以它的错你光靠看是看不出来的,必须靠规则把容易错的地方圈起来。圈规则这件事,就是修 Harness,它比换模型枯燥一万倍,也有效一万倍。
为什么大家只聊模型
既然如此,为什么圈子里的话题永远围着模型转?
因为模型是唯一可见的东西。发布会看得见,跑分看得见,界面里那个名字看得见。而 Harness 是隐形劳动:规则文件写了几十页没人看见,材料整理了两小时没人看见,纠正它的错误纠正了一个月没人看见。人类天然高估可见变量,低估不可见变量,这不是 AI 时代才有的认知偏差。
还有一层:模型是别人的,谈起来没有门槛,等新模型也不需要做什么,等着就行。修 Harness 是自己的活儿,要下场,要笨功夫,要在一个个具体案子里把规矩一条条磨出来。聊模型是观赛,修 Harness 是训练。观赛永远比训练舒服。
我见过最可惜的一种状态,是拿观赛的姿态等来了训练的时机,又用观赛的结论放弃了训练:试了一下裸模型,不行,得出结论“这东西不行”,然后继续等下一代。等下一代来了,重复一遍。每一代都被同一块石头绊倒,每一代都把石头记在模型账上。
我自己的做法
我现在的判断标准很简单:产出不行,先查自己。
顺序固定。第一步查数据:它该看的都看到了吗,看到的是干净的吗。第二步查规则:这件事的边界和标准我交代了吗,上次犯过的错写进规则了吗。第三步查交互:任务是不是拆得太粗,上下文是不是断了。三步查完还没解决,才考虑模型的事。实践里,走到第三步问题基本都死了。
换一种说法:模型是租来的,Harness 是自己的。租来的部分大家拿到的都一样,你的竞争力只能长在属于自己的那部分上。这也是我为什么从不焦虑新模型发布,什么时候出新、出多强,不由我控制;我的规则体系会不会更值钱,由我控制。把注意力放在控制得了的变量上,是个朴素但被普遍违反的原则。
收束
如果你身边也有人还在两极摇摆,一极追发布会,一极说不行,可以让他们做同一个测试:别换模型,把你上一次不满意的任务拿出来,只补三样东西,喂干净的数据,写清楚规则,把任务拆到能验收的颗粒度。产出还上不来,再来跟我讨论模型。
我的预判是,大多数人到不了讨论模型那一步。
模型可以少聊了。接下来的差距,不在你用哪个模型,在你给自己的模型配了什么马具。
作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。四明山法师 AI 夜校(legalAGI.cn)发起人。