8 月 12 日,OpenAI 发了一份企业 AI 使用报告。看完之后,有一个数字在我脑子里转了一天。

今年 2 月以来,OpenAI 企业客户里,agent 产品(Codex)的周活跃用户,增长最快的职能不是程序员。

是法律。

法律职能涨了 108 倍。同期,销售 41 倍,招聘 41 倍,市场 26 倍。工程——agent 应用的大本营——只有 5 倍。

一个以保守、谨慎、慢半拍著称的行业,成了 agent 渗透最快的知识工作领域。

为什么?

法律是代码之外,最像代码的工作

OpenAI 在报告里解释过软件为什么先行:代码库给了 agent 清晰的上下文,测试让产出容易被验证。agent 干活需要这两个条件——知道自己在哪,知道自己干得对不对。

拿这把尺子量一量法律工作,你会发现一个事实:法律是代码之外,上下文和可验证性都最充分的知识工作。

上下文充分。法律工作天然以文书为中心。合同、案卷、法规、判例、纪要,全是结构化文本。律师接手案件做的第一件事,就是把材料读进去——这正是 agent 最需要的那一步。

可验证。法条引用对不对,查得到;合同条款漏没漏,比得出;金额勾稽平不平,算得清。法律产出的对错有外部标准,不靠"感觉不错"。

OpenAI 说,通用知识工作此前推进慢,就是因为多数任务上下文有限、说不清、验不了。这三样毛病,法律一样都不占。

所以 108 倍不是意外,是结构性匹配。

企业客户 Codex 周活跃用户增长倍数 2026 年 2 月以来,按职能 · 数据来源:OpenAI Enterprise Signals 法律 108× 销售 41× 招聘 41× 市场 26× 工程

引用之前,先交代这个数的口径。

一个用户怎么被算进"法律职能",OpenAI 的公开页面没有说——是按企业后台登记的职位头衔映射,还是按消息内容里法律工作的占比打标,没有披露。配套的工作论文用的是职位头衔映射,而且论文自己认了两个局限:头衔覆盖不全;活跃用户的构成不等于该职能的采用率,因为拿不到每个职能全员的分母。

还有基数。agent 是先在工程落地的,今年 2 月法律职能的周活基数很小,低基数上的倍数天然容易放大。OpenAI 另一篇 Codex 专项论文里,内部法律岗位员工的月产出增长是 13 倍(按中位数计,去年 11 月到今年 6 月)——13 倍和 108 倍,测的本来就不是同一个东西,但放在一起,能看出口径对数字的影响有多大。

所以我的读法是:方向可信,五个职能里法律排第一,和上面的结构分析也对得上;具体倍数打折看。法律人引用数据,先把口径交代清楚,是本分。

分水岭:你问 AI 问题,还是 AI 交活给你

比 108 倍更重要的,是另一个数字:64%。

今年 6 月起,企业客户里 agent 的产出 token,占 agent 和 ChatGPT 总和的 64%。OpenAI 的企业级使用,越过了"辅助"和"执行"的中线。

这两个模式的区别,值得说透。

辅助模式,是你问 AI:"这个条款有没有风险?"AI 答一段,你自己回去改合同。问完你就走了,活还是你的。

执行模式,是你把 300 页尽调材料交给 agent,它读完、比对、输出一份带页码索引的风险清单初稿,你负责验收。

前者省的是"想"的时间,后者省的是"做"的时间。法律工作里,"做"的量远大于"想"——阅卷、比对、检索、写初稿,这些计件的苦力,正是年轻律师前三年的主要生活。

执行模式的效率是什么量级?报告里有个参照:Virgin Atlantic 的工程团队用 agent 重构遗留代码,原来要两周,现在三十分钟。

还有个数字,能看清这个分水岭正在多快地变宽。OpenAI 每月把企业客户按人均用量排名,前 10% 叫前沿企业,中间 10% 叫典型企业。今年 1 月,前沿企业的人均产出是典型企业的 2.6 倍。到 6 月,8.3 倍。

半年,差距扩大了三倍。而典型企业过去一年几乎原地踏步,只涨了 1.9 到 2.8 倍——多数组织还停在"拿 AI 当搜索框"的阶段。

我今年 5 月写过一篇《智力杠杆》,说 AI 会把专业服务者分成两种人。当时还是推演。现在 OpenAI 把数据拍在了桌上:杠杆两端的人,正在加速分开。而且这不是科技公司的专利——报告明说,前沿差距出现在所有行业、所有规模的公司里。

前沿企业 vs 典型企业:人均产出差距 前 10% 企业与中间 10% 企业的人均输出 token 之比 · 数据来源:OpenAI 2.6× 2026 年 1 月 8.3× 2026 年 6 月 半年,差距扩大三倍

倒挂的师徒制

第三个数字,我最想跟律所主任们聊:13 条。

OpenAI 统计了数百万次对话,发现企业引入 AI 六个月后,入职早期的员工比高管每周多发 13 条消息。直觉上,应该是高管更重视、用得更多。数据反过来:越往基层走,用得越勤。

这跟很多问卷调研的结论相反。但问卷问的是"态度",这次统计的是"行为"。行为不会客气。

律师行业的师徒制,建立在一个隐含假设上:经验从上往下传。师傅踩过的坑,徒弟一个个重新踩,十年出师。

这个假设正在倒转。新人没有经验可传,但他们有一样师傅没有的东西:从一开始就在跟 agent 协同干活,这种手感长在肌肉里。我不用想象这个画面——四明山法师 AI 夜校的每一次分享,最活跃的永远是年轻人。

对合伙人来说,真正的含义是:人人都在用 AI,"我也用了"不构成任何竞争力。构成竞争力的是另一件事——你几十年踩坑换来的判断,有多少被结构化了、写成了 AI 可执行的规则、变成了团队 agent 的工作标准。

OpenAI 的数据支持这个判断:前沿企业里有 19% 的周活用户在使用 skills——可复用的指令集,说白了就是把"怎么做"沉淀下来给 AI 用。典型企业只有 3%。同一份报告里,OpenAI 内部员工的 Plugins 周使用率是 95%。也就是说,连前沿企业自己,离"用满"都还远。

经验值钱,但前提变了:得写成规则、写成清单、写成 agent 能读的东西。只存在脑子里的经验,传不了徒弟,也传不了 AI。

两个质疑,我认真回答

第一个质疑:token 量不等于价值。法律产出错了代价很高,量再大有什么用?

质疑成立。OpenAI 自己也承认,token 只是使用深度的代理指标。但我的回应是:正因为如此,法律人最该练的本事是"敢交活,会验收"。验收恰恰是法律训练的核心——我们一辈子都在做证据审查、文书校对、交叉核对。别的行业要新学验收,我们只是把验收对象从实习生的活,换成了 agent 的活。

第二个质疑:这是美国企业的数据,中国法律市场不一样。

工具确实不同,政策环境也不同。但方向一样。而且我倾向认为,国内律所的差距会拉得更大——多数律所连"问"的阶段都还没普及。差距的基数越低,拉开得越快。

我自己怎么做

说说我自己。不是建议,是交代。

我把十几年的执业规则,一条条写成了 AI 可读的规则库:合同审查的底线清单、检索的改写纪律、文书的结构要求。agent 按我的标准干活,我负责验收和拍板。这就是 OpenAI 说的 skills,我没等厂商来定义,自己动手先做了。

这套东西我建了一年多,中间推翻重写过,到现在也只覆盖日常工作的六七成。剩下的三四成,要么是我自己也说不清标准的判断,要么是规则写出来 agent 执行就走样的活儿——这部分我还没找到答案。

律所层面,我的观点和今年 5 月写《AI 落地律所伪命题》时一样:组织买不来落地。但这次的数据让我能把话说得更准——前沿企业真正在做三件事,采购账号不在其中:给 agent 接上上下文和工具,给高风险动作立审查规矩,把一线员工摸索出的好用法变成全组织看得见的实践。

主任们与其问"所里要不要推 AI",不如先问一句:所里那几个把 agent 用活的律师,他们的做法,全所有多少人见过?

法律行业花了一百年,建立起"经验按年限从上往下传"的管道。

agent 用半年证明了另一件事:判断力不只靠年头积累,它也可以被结构化、被复用、被放大。

108 倍只是开场。真正的问题是,一年后再看这组数据,你在 8.3 倍的那一边,还是原地踏步的那一边?


作者简介: 陈石律师,浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办"首宗百亿地王""长春第一高楼""台州第一高楼"等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。四明山法师 AI 夜校(legalAGI.cn)发起人。