——《人工智能司法应用的深圳实践》白皮书深度解读

文中引用的白皮书内容与数据,均出自2026年9月中共深圳市委政法委员会、深圳市中级人民法院、深圳市政务服务和数据管理局联合发布的《人工智能司法应用的深圳实践》(下称《白皮书》)。深圳系统的运行数据为发布方报告口径,本文在引用时逐一注明。对若干尚待时间检验的问题,本文第四部分给出了我的观察——它们不是挑剔,恰恰是因为重视。

引子:一份等了两年的白皮书

2026年9月23日,深圳发布了《人工智能司法应用的深圳实践》。

这不是AI第一次进入中国法院。从2017年电子卷宗随案同步生成算起,机器参与办案已经第九年;深圳自己的AI辅助审判系统,2024年6月就上线了。如果只是"某法院又上线了一个AI系统",不值得专门写一篇文章。

值得写,是因为这次不一样。这份约90页的白皮书,第一次由一家法院系统把三年的AI实践,公开整合成一套完整的东西:技术系统、业务流程、组织机制、治理规则,以及对未来司法形态的设想。它不是工作总结,也不是新闻通稿。它有方法论,有试错记录,有负面清单,甚至有一份面向全国的《司法领域智能体技术应用指南》。

打个比方:过去我们看到的,是一台台单独的机器;这次看到的,是一条生产线的图纸,包括哪里该有人站着、哪里该装保险丝。

我读完全文,总体判断是:这是中国"AI+审判"从地方试验走向制度总结的一个节点。它提供的参考价值,不止于法院系统——对仲裁机构、对律师行业、对所有想把大模型用进严肃工作的人,都是同一张图纸。

还有一层私人的原因。我从2025年起办了一所公益的AI夜校,带着法律人学AI,已经办到第四期。夜校讲到第三期时,我们花了很多时间讲几个观念:人在环中、驾驭工程、垂类模型的局限、数据和规则比模型更重要。读《白皮书》时我不断停下来:这些理念,深圳的法官们用三年时间、几百万次真实调用,走了同一条路,而且走得比我设想的更工程化、更彻底。

这篇文章分四部分:先把《白皮书》的内容讲全(第一、二部分);再把它和夜校的理念逐条对照(第三部分);最后谈谈这份白皮书在往前推进时,哪些问题值得持续关注(第四部分)。

一、先看清楚:深圳这三年到底建了什么

讨论理念之前,先把事实盘清楚。《白皮书》给出的信息量很大,我把它压缩成四个问题:为什么是深圳、系统长什么样、规模有多大、它是不是一个"活系统"。

1.1 为什么是深圳:AI审判的前提是九年数据工程

很多人以为AI审判是2023年大模型火了之后的事。深圳的时间线说明,真正的起点要早得多。

2017年,深圳法院启动电子卷宗随案同步生成;2018年推广无纸化办案;2019年上线移动微法院;2021年起编纂100多个案由的类案审理指南。到2022年,"单套归档"试点通过国家档案局验收。截至2026年8月31日,升级后的"深圳数字法庭"实名注册用户近300万,累计办理案件超490万宗,在线庭审超27万次,电子送达文书超5908万份,全市法院超过90%的诉讼材料收发和送达在线上完成。

这组数字说明了什么?说明大模型出现的时候,深圳手里已经有了一套结构化的案件数据、一条在线化的办案流程、一套成文化的审判知识。AI审判不是"给法院装个大模型",而是"给已经数字化的审判流程装上一个智能引擎"。没有前面六七年的数据工程,后面七个月的系统开发无从谈起。

压力端也是真实的。深圳常住人口1824.85万,实际管理人口超2200万,商事主体465万户,民事诉讼占法院案件总数超过92%。《白皮书》序言直言,要缓解"案件总量大"与"定分止争难"之间的矛盾。2026年,全美已有13个法院因人均年加权案件量超600件进入"司法紧急状态",部分法院超过800件;巴西一审民商事案件平均审理周期约850天;印度地区和基层法院未结案件接近5000万件。案多人少不是中国独有,深圳只是把这个全球性矛盾摆在了AI面前。

1.2 系统长什么样:六大场景、两类智能体

按《白皮书》的框架,系统覆盖六大业务场景:

智能立案审查。35项立案审查标准编排为可执行规则,材料一致性、管辖、及时性自动核查,一次性告知补正。2024年1月最先上线,从最规则化、材料重复度最高的场景切入,这个顺序选得很专业。截至发布,已辅助审查超过130万宗申请,覆盖473类民商事案由。

智能阅卷核验。卷宗自动编目、分类、提取信息,提取结果与原始材料同屏对应、一键溯源。原本耗时一整天的工作压缩至数十分钟。这个设计的关键不在快,而在"溯源"——法官看到的每一条提取结果都能点回原始卷宗。

智能庭审辅助。庭前生成审理要点和"剧本式"提问参考,庭中推送突发状况处理指引(应对证据突袭、前后反言),庭后归整笔录。

智能案情研判。系统的中枢,覆盖诉辩概要、事实认定、审理要点、确定判项四个部分,在法官确认后辅助撰写说理。

智能文书草拟。依据法官已确认的事实、争点和法律适用生成初稿,内置格式校对和"挑毛病"式反向审核,还以当事人立场研判服判息诉。《白皮书》明确:禁止"一键生成结论"。

智能知识检索。与清华大学合作引入SAILER模型,法条和参考案例只从最高人民法院权威知识库抓取,累计提供2274.6万次知识服务,是全系统调用最频繁的智能服务。《白皮书》的原话是:"系统推送的每一条法律依据都是'真的',且可以追溯出处。"

在这六大场景之上,2026年上线的两类智能体把系统推到了新形态:

人机协同智能体,面向具体案由做要素抽取,配上"法律计算器"(加班工资、人身损害赔偿、夫妻共同财产清算等——智能体负责提取变量,计算器负责运算,用分工防"数理计算幻觉"),加上"第三屏"对话和法官自定义指令共享的"指令广场"。

流程驱动智能体,面向程序性事务:自动感知案件状态、生成待办、在法官确认后推进操作。已完成民商事案件5个阶段、18个环节、140个业务场景的设计,梳理了近500个案件办理状态下的700多项触发条件。用《白皮书》的话说,是"从人找事"变成"事找人"。

三大诉讼也做了差异化设计:民事是基准盘;刑事突出"以证据为中心",按"确实充分、排除一切合理怀疑"提供分析参考;行政按"全面体检"原则做整体合法性审查推理。这种按诉讼类型分治的设计,说明这不是一个通用聊天机器人套壳。

1.3 规模有多大:数据与口径

按《白皮书》第四章,截至2026年8月31日:

  • 累计调用大模型、智能体完成任务3545.1万次;
  • 辅助阅卷60.9万件;
  • 辅助庭审26.9万次;
  • 辅助撰写裁判文书稿67.8万份;
  • 深度赋能超过70万宗案件;
  • 2025年办结各类案件773828件,法官人均结案744件,同比增加249件;人均月结案数较上线前提升60%;
  • 上诉率下降48%,改判发回重审率下降65%。

引用这组数据要说清楚口径:"次""份""宗"是不同量纲,调用量不等于案件量,辅助文书稿不等于最终采纳。深圳政府门户2026年4月披露的年度同比口径是上诉率下降35.1%、一审改判发回重审率下降33.3%——两组数字基期和统计范围可能不同,本文不擅自调和。

但即便把口径全部收紧,有一点的证据是充分的:这套系统不是概念验证,它已经进入数千名法官和司法辅助人员的日常办案,规模在真实发生。这本身就是全球司法AI实践中没有先例的事。

1.4 它是一个"活系统"

《白皮书》对系统自成长性的描述,是我认为工程上最有含金量的部分:

  • 超1000项经认证的业务标准技能(Skill);
  • 近200名不同领域法官制作超5000道司法场景专用评测题;
  • 大模型可按任务替换,各模块松耦合、可插拔;
  • 集成6家产学研主体技术;
  • 3次重大架构演进,500余次敏捷迭代;
  • 模型替换走"跟进—测试—替换—上线—反馈"闭环,用那5000道题做准入门槛。

这意味着深圳没有把宝押在某一个模型上。模型会过时,评测题库、认证Skill、业务规则文档(核心团队撰写了10余万字)不会过时。用《赋能法律人》里我反复讲的一句话来说:模型是电力,系统真正值钱的是配电工程。

二、白皮书最该被读的部分:三次试错与"驾驭工程"

如果只读《白皮书》的一章,我推荐第三章"创新亮点"。这一章公开了三次完整的试错转向,比任何"全球首个"的表述都更有价值:一家法院系统公开承认自己走错过,并说清楚为什么错,这在国内的官方文件里极少见。

2.1 第一次转向:垂类模型不是完整产品

研发初期的思路很自然:用大规模法律语料训练一个法律垂类模型,让它直接处理审判任务。2024年4月,他们完成了全国首个司法审判垂直领域大模型训练。然后发现:再强的垂类模型,本质上仍是问答工具,无法端到端满足案件工作。

《白皮书》第五章的原话:"市面上的大模型,无一能满足生产环节的落地需求。"自建的垂类模型也没好到哪里去。

于是路线切换:垂类模型退回去做理解、检索、比对、整理,端到端的任务交给"工作流编排+专家Skill+工程化组装+法官确认"。

这个转向,我在夜校第三期先导课里专门讲过——垂类模型是很多法律科技项目掏钱的理由,但它撑不起生产系统。深圳用真金白银和七个月研发验证了这件事。

2.2 第二次转向:模型参数不能当法律知识库

第二个试错更根本:只要大模型把自身参数作为法律知识的来源,幻觉就无法避免。《白皮书》对此毫不回避,原话是:"只要大模型将自身参数作为知识来源,幻觉就无法避免。"

解法是把知识来源整个抽走:法律条文和参考案例只从最高人民法院持续更新的权威知识库抓取,模型无权"补全"任何法律知识。垂类模型负责理解、检索、比对、整理和搬运。

配套的是四层防幻觉防线:知识准入、安全护栏、法官确认贯穿全流程、全程可视化溯源。《白皮书》称之为"白盒式"可信辅助——"法官不仅看到结论,更看到结论是如何得出的。"

同时它保留了诚实的边界:附录的术语定义明言,幻觉"无法完全消除"。这句话的分量不轻——它意味着"从源头杜绝幻觉"这类口号并没有出现在这份白皮书里,出现的是工程控制加人工核验。

2.3 第三次转向:标准化与个性化并存

第三个试错关于人。统一编排的专家流程,覆盖不了不同法官、不同案由、不同说理风格。《白皮书》的结论是:"个性化不再是边缘需求,而成为系统设计的核心假设。"

系统因此开放"指令广场"和个性任务,让法官沉淀自己的指令和用法;但经认证的原子Skill、关键步骤审核、"不允许一键裁判"这些底线保留。用《白皮书》第二章的话说,法官"不再满足于一个中规中矩、可以达到80分的通用助手",需要一个"更懂得具体业务语境"的专业搭档。

2.4 把这些串起来:驾驭工程

三次转向合在一起,就是《白皮书》自己命名的方法论:驾驭工程(Harness Engineering)。核心公式写在术语定义里:智能体=模型+驾驭框架(Agent = Model + Harness)。理念表述是八个字:"人类掌舵,智能体执行。"

《白皮书》第三章有一句话,我认为是全篇的技术判断核心:

"在垂直领域,驾驭工程的精细化程度比模型参数量更能决定实际效果。"

以及第三章第二节那句更直白的:"不是让模型更聪明,而是让模型在司法环境中更可靠地工作。"

沿着这个方法论,系统落成了一条完整的链路:司法数据与电子卷宗→权威法律知识库→通专结合的多模型→认证Skill→智能体与工作流编排→法官决策节点→安全护栏、权限、日志与回滚→裁判文书和程序动作。

深圳系统的链路:模型被包进驾驭工程 司法数据与电子卷宗 权威法律知识库(唯一来源) 通专结合多模型(可装配、可替换) 驾驭工程 Harness(智能体 = 模型 + 驾驭框架) 认证Skill白名单 工作流编排 安全护栏·熔断 日志·溯源 法官决策节点:确认 / 修改 / 拒绝(全程留痕) 裁判文书与程序动作

安全体系也是工程化的:政法专网物理隔离部署;DevSecOps把代码审计、脱敏规范、漏洞扫描嵌入研发;最小权限;任务级与系统级熔断;记忆按案件隔离、按任务清零;专职安全专员享有独立安全审查权和一票否决权。2026年6月,系统通过中国信通院(泰尔实验室)智能体安全能力评估,达到最高的5级。

2.5 治理规则:先画红线,再谈能力

《白皮书》最有制度价值的部分,是附录的《司法领域智能体技术应用指南》V2.0。按发布方表述,这是全球首个司法领域智能体技术应用指南,2026年4月首发,9月迭代到2.0。

指南的结构是"四类新风险+四项正向原则+四项负面清单+四阶段方法":

四类新风险:权责僭越导致司法核心职权"空心化"、指令污染、过程失范、系统失控。

四项正向原则:锚定辅助工具定位、深度融入审判环节、同步落实司法责任、全程确保数据安全。这四条其实是2023年研发启动前就定下的——先画红线,再研发。

四项负面清单:禁止转授决策性职权;禁止注入未治理数据;禁止应用未认证Skill;禁止逾越安全护栏。

四阶段方法:定义任务、监督过程、核验输出、驾驭环路。指南还给了口诀——"定得准、看得透、核得严、改得勤";方法论是"运行—核验—修正—再运行"。甚至有停止条件:同一错误经两轮定向修正仍复现,即认定超出智能体当前能力边界,转人工办理。

再往上,是《白皮书》序言的那句总纲:"司法权本质上是判断权,判断权必须牢牢掌握在人的手中。裁判权只能归属于法官,司法责任亦由法官最终承担。"

具体制度都从这句话长出来:证据采信、事实认定、法律适用、裁判结论由法官确认;不提供"裁判建议""一键生成结论";每次确认、修改、拒绝全程留痕;坚决杜绝形成跳过人工判断的自动化链路。

《白皮书》第六章还列了五组"可以但不能":可以辅助法官但不能取代法官;可以提供参考意见但不能作出裁判结论;可以参与信息处理但不能替代司法判断;可以提升办案效率但不能弱化程序正义;可以促进裁判尺度统一但不能僵化个案裁量。并列出AI在未来相当长时期内不能替代的五类任务:证据真实性的最终判断、复杂事实争议的最终裁决、真实世界情境的充分理解、重大伦理价值争议的裁判、司法程序的正当性功能。

读到这里,我对这份白皮书的好感是具体的:它没有回避AI的能力边界,而是把边界写进了负面清单和停止条件。这与最高人民法院法发〔2022〕33号意见"AI不得代替法官裁判"的定位一脉相承,而且把它工程化了。

三、理念对照:白皮书与我的AI夜校,走的是同一条路

从2025年起,我办了一所公益的AI夜校,到第三期时形成了相对完整的课程框架:先导课讲认知,第一到三节讲agent的底层结构,第四到六节按"模型、算力、数据"三要素展开,返场课请一线使用者复盘。整个课程体系,用一句话概括,就是教法律人做一件事:把AI从一个"会聊天的模型",变成一个"能干活的、可控的生产系统"。

读《白皮书》时我最强烈的感受是:双方没有商量过,却走到了同一个方向。下面我把这些重合逐条摊开。这种对照不是要证明"我们早就说过"——夜校讲的是律师视角的个人工作流,深圳做的是法院视角的组织级生产系统,量级完全不同。让我确认的是另一件事:这些理念不是某一家的一厢情愿,而是大模型进入严肃专业领域的普遍规律。

同一张图纸的两个尺度 AI夜校(律师个人工作桌) 深圳白皮书(法院组织级系统) 可溯源·可对抗·可负责 验收AI成果的三道门 法官确认节点+一键溯源+全程留痕 禁止一键生成结论 智能体=模型+马具(harness) 模型够用了,更要关注驾驭 智能体=模型+驾驭框架 驾驭精细化比参数量更能决定效果 输出不可靠,先查数据不查模型 输入没读全,提示词再好也没用 权威知识库是唯一知识来源 模型无权补全法条与案例 垂类模型本质是问答工具 差异在规则,规则自己能构造 第一次转向:垂类模型→工程化交付 公开承认试错 产出=你的认知×AI倍数 决定性因素在使用者 会用者赋能、误用者负能、善用者驭能 指南V2.0第五节 方向一致,尺度不同,互为印证

3.1 人在环中:从口号变成了一整套权限设计

"人在环中"(human-in-the-loop)是AI治理的通用口号,喊的人很多,把它做成工程的很少。《白皮书》的做法是把这句话拆成了具体机制:系统推送分析、法官作出决策;证据采信、事实认定、法律适用、裁判结论由法官确认;不提供"裁判建议""一键生成结论";每次确认、修改、拒绝全程留痕;对行动型智能体设熔断和回滚。用《白皮书》序言的话说:"司法权本质上是判断权,判断权必须牢牢掌握在人的手中。"

夜校第二节课讲agent权限模式时,我给学员演示过同一套逻辑在个人工具里的样子:默认模式下agent每一步操作都要人确认;要删文件,它会问"移到废纸篓还是彻底删除";计划模式下agent只出计划、人批准了才执行。当时的说法是:把"该确定性交给代码、该判断的交给模型加人"。深圳把这个思路推到了组织级:熔断、回滚、留痕、一票否决。在机器的每一条执行路径上,预置一个人的决策点——两边做的是同一件事。

我在2026年9月20日"AI赋能·智启仲裁"论坛的发言里,把这个思路压缩成验收AI成果的"三道门":可溯源、可对抗、可负责。AI读了哪些材料要能追回去;结论有没有被对手攻击过;错了谁负责。《白皮书》的一键溯源、反向审核、法官留痕,几乎是这三道门的司法版本。这不是我比深圳高明,恰恰说明:一个专业领域认真对待AI,无论起点是律师的个案工作还是法院的审判流程,最后都会长出相似的控制结构。

3.2 从模型中心到驾驭工程中心:马具比马重要

《白皮书》最有理论价值的命名是"驾驭工程"(Harness Engineering),公式写得很清楚:智能体=模型+驾驭框架。还有那句判断:"在垂直领域,驾驭工程的精细化程度比模型参数量更能决定实际效果。"

夜校第二节课讲这个公式时,用的是马具的比喻:一匹良驹能力很强,类似一个大模型,但它没有方向感;不能被很好地控制,就不能被很好地应用。harness本义就是马具,马鞍、缰绳构成的这套东西,让人能驾驭这匹马。模型再强,没有马具,它只是一匹跑得快的野马。

再往深一层是产业结构上的判断,我在夜校借用了工业史的说法:大模型是电力,智能体是流水线上的岗位,而 harness 是你自己的配电系统。电力终将人人可得,配电工程才是各家的壁垒。落到《白皮书》上看得更清楚:深圳投入上亿财政经费、230P算力,接入近万亿字量级的权威法律语料,但这些不是壁垒;真正难复制的是那1000多项认证Skill、5000道评测题、85项拆解到环节的流程和10余万字业务规则文档——模型可以换(他们已经换了三轮),这套驾驭体系换不掉。

夜校里我反复讲"模型不是稀缺资源,判断力是";《白皮书》说"不是让模型更聪明,而是让模型在司法环境中更可靠地工作"。两句话讲的是同一个常识,只是我们的常识还在被"哪个模型更强"的口水战淹没。

3.3 垂类模型的祛魅:第一次转向的分量

《白皮书》公开的第一次转向,是在完成全国首个司法审判垂类大模型训练之后,承认它"本质上仍是一个问答工具",转向工程化交付。这个自我否定的分量,只有踩过同一个坑的人才懂。

垂类模型曾是法律科技行业最大的融资故事。夜校先导课讲这个话题时,我说过一个略显尖锐的观察:市面上大部分法律垂类产品,底层接的都是通用大模型——接DeepSeek、接千问,这些模型谁都能接;产品真正的差异在规则,而规则恰恰是你自己也能构造的,甚至可以构造得更丰富,因为它装的是你的客户习惯、你所在地区的裁判尺度。当时还举过一个例子:一个叫"金牌大状"的skill,效果与名字毫无关系,只与名字背后写了什么规则有关系。

深圳的实践把这个判断从产品层面推到了司法层面:垂类模型负责理解、检索、比对、整理和搬运,无权"补全"任何法律知识;知识来源整个切换到最高人民法院权威知识库。垂类的价值不在"训练了一个法律模型",而在"围绕法律工作重建了一套知识秩序"。这是《白皮书》第一次转向真正值得记取的结论。

3.4 数据与规则先于模型:输出不可靠,先查数据

防幻觉的四层防线,第一层是知识准入:严禁模型自行生成法条案例,权威知识库是唯一来源,模型只做理解和搬运。用《白皮书》自己的话:"只要大模型将自身参数作为知识来源,幻觉就无法避免。"

夜校第六节讲数据时,给过学员一个更朴素的排查口诀:agent输出的答案与你读案卷的印象有偏差,脑子里第一反应不该是"这模型不行",而应是"数据出了问题"——大概率是输入端没读全、读错了,而不是模型能力不够。配套的机制包括:二进制文件必须先转换、转换必有损失、损失掉的可能恰好是关键信息(比如扫描件的印章颜色、位置);输入超过上下文窗口的部分模型根本不读;资料量过大时模型会"抽着读"。夜校第二节有一句提醒:"你如果假设大模型100%读完了你的材料,你在用agent的时候就很容易上当。"

两边在方法论上完全同构:可靠性问题的第一性是数据问题,不是智力问题。区别只在尺度,夜校教的是个人核对输入,深圳建的是组织级的知识准入制度。深圳还把这件事做到了源头:人民法院出版社提供近万亿字量级的权威语料,类案审理指南从2021年起编纂了100多个案由。先有权威知识的工程化,才有"系统推送的每一条法律依据都是真的"。顺序反了,做什么模型都白搭。

3.5 认证Skill与经验沉淀:让经验成为组织资产

还有一个容易被略过的数字:超1000项经认证的业务标准Skill,由技术管理部门和审判管理部门共同做前置认证、变更审批、定期复评。近200名法官制作了超5000道评测题,模型或Skill要过题库才能上线。

夜校讲Skill时有两个观点,恰好构成这个机制的注脚。第一个:"点一个按钮,等于给了他一本书"——每个Skill背后是一包规则文件,规则质量决定产出质量。第二个更直接:Skill的好坏,取决于文件夹里写的规则质量,而规则恰恰是专业知识;同一个skill,不同专业底子的人调出不同质量的结果。所以关键从来不是"装了多少个skill",而是"谁在写规则、规则经不经得起检验"。

深圳的认证机制回答的正是这个问题:让法官的经验从"个人手艺"变成"经过验证的组织资产",并且用评测题库做准入门槛。这和《白皮书》第五章说的"个体经验提炼为全员可用的技能工具"是一件事的两面。返场课上嘉宾谢凯演示民商事诉讼全流程skill时说过一句话,我在总结时记下了:"这套skill不像chatbot一下输出几千几万字,一轮产出的时间更长,但更长反而跟质量是等价的。"经认证、有题库的Skill,慢一点,但对司法场景来说是唯一可接受的速度。

3.6 会用者赋能、误用者负能:决定性的变量是人

《白皮书》附录指南里有一句话,我读到这里停了很久:

"会用者赋能、误用者负能、善用者驭能。"

指南承认:同一个系统,使用者的任务定义、过程监督和结果核验能力,本身决定风险水平。安全不再全部寄托在产品上,而落在使用者素养上——这是从"产品合规"走向"社会技术系统治理"的判断。

这恰恰是夜校第一课就讲的话。先导课给过学员一个公式:AI是智力杠杆,最终效果等于你的认知基础乘以倍数——"如果自己的认知就很低,给你一个智力放大器,乘再大的倍数,加成也是有限的。"第四节又给了另一半:"agent只能算半个工具,另一半能力靠你把自己的判断和默会知识显性化加上去。"

这六条对照摆下来,结论其实已经藏在里面:大模型进入专业领域,真正的分野不在"用不用AI",而在"有没有把模型放进规则、流程、责任构成的结构里"。深圳用三年时间和3545.1万次调用验证了这个结构在司法领域成立;夜校用三期课程在律师个人的工作桌上验证了它的日常版本。方向一致,尺度不同,互为印证。

四、往前看:几个值得持续关注的问题

写到这里,《白皮书》值得肯定的部分已经讲完。但一份负责任的解读,不该停在鼓掌。下面几点不是批评——恰恰是因为我认为深圳方案值得走得更远,才把这些写出来。它们的共同点是:都不是今天的问题,而是规模扩大之后、时间拉长之后,会慢慢显形的问题。

4.1 第一个问题:人在环中的"人",如何长期保持清醒

《白皮书》的制度设计里,裁判权牢牢在法官手中,这一点毫无疑问。但制度设计回答的是"权力归属于谁",回答不了另一个问题:"这个人此刻是不是真的在判断。"

大量文书由AI起草初稿、法官审核确认,这个流程跑几千次之后会发生什么?每一次审核都是真实的脑力劳动:核对事实、检验说理、挑出毛病。人是会累的,而AI的初稿会越来越流畅、越来越像"正确的样子"。一个人连续几十次看到的初稿都没问题,下一份的注意力就不可避免会下降。审核还在形式上进行,判断已经悄悄退场——这就是"人在环中"向"人在名单上"的滑动。

学术研究已经观察到了这个机制的方向。两位研究者Liu与Li在2024年进入深圳法院做田野调查,访谈了近20名法官,把当时的人机互动概括为:法官先形成初步判断,大模型围绕这个判断生成支持性说理,法官修改后定稿。论文提出了一个概念叫"偏见回声"——如果AI总是围绕法官的初判组织证据和理由,它可能强化初始判断,同时削弱法官通过亲自写作发现错误的机会。需要说明,这项研究的模拟实验证据是混合的,尚不能证明深圳系统已经导致系统性偏见;它真正的价值是提醒了这条风险路径的存在。

我自己在律师工作桌上遇到过同一个问题的变体。2026年9月仲裁论坛的发言里,我讲过一次实测:把一整包仲裁材料交给六个AI角色分工处理,最后汇总出一份裁决书初稿,结构完整、争议焦点抓得准,超过不少助理的第一稿。但仲裁法的版本用错了,还有一段说理"太周全,反而没有真正回应这个案子的特殊性"。写没问题,审要靠真正理解案件的人。

更值得警惕的是同场嘉宾、资深合伙人邬辉林复盘四个多月深度使用时说的几个细节。他说AI代写的材料他"看一遍感觉都是一片脑雾",开庭被问到细节时,不像自己写的材料那样能立刻定位;他说团队出现了"精神滑坡",连自己都"愿意花时间写提示词,不太愿意花半小时改合同",后来把合同审核收回来自己做,"反而更加神清气爽";他还说了一句我认为值得所有AI重度使用者贴在屏幕上的话:"你的思维必须像刀,不能让它生锈。"他的对策是把自己做诉讼的顺序反过来:先人工把卷仔细读一两遍,知道重点之后再让AI阅卷,提示词只要四百字就非常准确。

这个顺序,就是我在论坛发言里给年轻律师的建议,也是我认为对法官同样成立的原则——在看到机器生成的文本之前,先看完案件材料,先形成自己的初步判断。哪怕只用十分钟,写下争点是什么、哪一方证据更强、自己最没把握的地方在哪里。没有自己的第一版,就没法比较;AI说什么,很容易变成"我本来也是这么想的"。

看AI初稿之前,先有自己的第一版 滑向依赖的顺序 直接打开 AI初稿 顺着初稿 读材料 "和我想的 一样" 少量修改 确认 保持判断的顺序 独立阅卷 先看完材料 写下初判 十分钟就够 再看AI文本 对照差异 对抗核验 再作决定 顺序颠倒的代价 AI围绕初判组织理由 → 错误的初判更难被推翻(研究者称之为"偏见回声") 审核仍在形式上进行,判断已悄悄退场:人在环中 → 人在名单上

值得肯定的是,《白皮书》和指南已经内置了方向一致的控制:文书环节的"挑毛病"式反向审核、以当事人立场研判服判息诉、指南要求核查不同观点是否均衡、智能体任务的纠偏与停止条件。这些设计说明发布方对"AI只会顺着你说话"的风险有认知。接下来值得期待的,是这类控制长期有效性的实证:法官实际的修改率、拒绝率、编辑距离,会成为比调用量重要得多的指标。某种意义上,这套系统未来最该被研究的,不是它生成了多少文书,而是法官对生成结果做了多少真实的改动。

4.2 第二个问题:系统建设很快,认知建设要跟上

这是我最想展开讲的一点。

生态培育这件事,《白皮书》第五章有专门交代:转变法官观念、培训法官技能、革新管理机制。"启明讲师团"由一线法官授课,全员分层实操培训,2025年"鹏法天平杯"技能竞赛有4100多名司法人员参赛,"鹏法AI"专栏选登了103篇法官文章。这套动作说明,深圳对"人"的投入是有制度安排的,这个自觉在建设方里已属前列。

我想补充的是另一个视角:AI系统与传统软件有一个本质区别。传统软件交付即可用,AI系统的效果上限,取决于使用者的认知水平。传统软件的逻辑是"你按按钮,它出结果",人的角色是操作员;AI系统的逻辑是"你定义任务、监督过程、核验输出",人的角色是驾驭者。前者的学习成本是"会不会点",后者的学习成本是"懂不懂它在干什么、不能干什么"。同一个系统,交给两个认知水平不同的人,产出的差距不是百分比,是性质上的。

这就是指南那句"会用者赋能、误用者负能"的深意,它其实承认了:系统风险的最小单元不是服务器,是人。一个不清楚模型会"抽着读"卷宗的法官,可能把一份没有读完的AI摘要当作"全案已阅";一个不了解幻觉机制的法官,可能把流畅的说理当作正确的说理;一个不知道模型边界在哪里的法官,要么事事不信、退回手工,要么事事相信、放弃判断。对边界能力没有清晰认知的使用者,驾驭不了驾驭工程。系统不但不会成为助力,反而会成为负担。这不是假设。行业里已经有真实的复盘:前面提到的"脑雾"、"精神滑坡"、"监工感",都是认知没有跟上工具迭代速度时,人的真实状态。

深圳的系统当前主要由深度参与研发的法官群体使用,认知水位是够的——40名法官参与研发、300余名参与测试,这批人天然懂系统。但《白皮书》发布同月,流程驱动智能体首个版本才上线,功能纳入最高法院"一张网"后全国多家法院正在试运行。每扩围一批新法院,就有一批从未参与研发的裁判者第一次面对这套系统。深圳经验的迁移,系统是现成的,认知不是。如果在扩围节奏里,把使用者培训与考核放到和系统部署同等重要的位置——甚至更靠前——这份白皮书的经验才算真正复制过去了。夜校这类民间实践能补一部分,但司法系统内的认知建设,最终还得靠制度化的安排。这是我认为这份报告推向全国时,比算力和经费更值得投入的一件事。

4.3 第三个问题:让数据继续说话

《白皮书》披露的成效数据里,调用量、辅助量是充分的,但有几类数据还没有出现:法官对AI输出的采纳率、修改率、拒绝率;系统提示的错误被人工发现的比例;反向审核实际拦截了多少问题;不同案由、不同资历法官的使用差异。

为什么要盯着这些数字?因为它们回答的是AI司法应用最核心的问题:这套系统在多大程度上改变了裁判本身。上诉率下降48%、发改率下降65%是了不起的结果,但《白皮书》自己也很诚实地写明,同期还有类型化案件专业化审判、审判管理机制改革等多项措施在同步推进。要把AI的净贡献分离出来,需要更细的评估设计——这也是系统走向全国之前,一项回报很高的基础工作。

另外两处细节值得留意。其一是《白皮书》第六章已经提出把事实摘要、争点归纳等派生信息反馈给当事人、征询意见,经当事人反馈、法官审查、程序确认后再作辅助参考——这是"内部在环"走向"外部可知"的关键一步,方向很好,期待它从愿景变成制度文本,包括告知的范围、异议的效力和复核的救济。其二是对老年人、残障人士等群体保留人工和线下替代渠道的承诺,数字鸿沟被写进白皮书,这在同类文件里不多见,落地的分量取决于后续的资源安排。

4.4 第四个问题:扩围的节奏,把"用好"当作"铺开"的前提

2026年3月,系统功能已进入11个省(区、市)23家法院试点;白皮书发布时,"一张网"试运行还在扩大。可以预期,接下来会有更多法院接入。

深圳模式里有几样东西可以平移:电子卷宗与数据标准、权威知识库接入、认证Skill机制、日志与回滚、评测题库。但也有一样东西无法平移:三年迭代沉淀下来的使用经验和组织默契。返场课上有学者提到一个观察:AI辅助裁判的壁垒不只在skills,更在"隐性数据"——本地法官的裁判习惯、证据认定尺度、量刑衡量习惯。这套东西深圳沉淀了三年,其他法院要重新长出来。所以扩围的合理节奏,可能不是复制系统,而是复制"系统加认知加本地化验证"的整套打法——先在本地案件结构上验证,再放量。慢一点铺开,把每一批用好,比快一点铺开更重要。

结语:未来已来,智在人为

《白皮书》的结语标题起得很好:"让技术走向人,让正义更可及。"扉页上还有八个字的口号:"未来已来,智在人为。"

我愿意把这份白皮书理解为中国司法对"智在人为"四个字的工程化注解:人是裁判者,这个定位在负面清单里、在法官确认节点上、在每一行日志里;"驾驭"是这个时代法律人的核心功课——不是驾驭一个更聪明的模型,而是建设一套让模型可靠工作的工程,并且让自己配得上"驾驭者"这三个字。

三年前,"AI辅助审判"还是论坛上的概念争论;今天,它是一座城市的日常司法基础设施,有3545.1万次调用的体量,有写进指南的负面清单,有国际同行的实地考察。进度之快,超出了包括我在内的大多数观察者的预期。而《白皮书》最让我确信的一点是:深圳想清楚的,恰恰是"快"的反面——哪些环节永远不能快,哪些判断永远不能外包,哪些人必须始终站在环里。

模型还会一代代变强。但驾驭模型的工程能力、维持判断的认知能力、承受责任签名的担当能力,不会随着参数量自动生长。这三样东西,法院要建,律师要练。每一个打算和AI长期共事的专业者,都躲不开。

路可以缩短,不能被走掉。


作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办"首宗百亿地王""长春第一高楼""台州第一高楼"等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,创办"四明山法师AI夜校"并已办至第四期,在多地开展相关主题讲座与分享。