最近留意到一类产品的宣传套路:把文档上传到网站,点一下脱敏,敏感信息被替换成代号,需要时还能还原回来。宣传语里最打动人的,是这么一句——保证 100% 不进大模型。

很多同行的顾虑正是“材料进了大模型会不会泄密”,看到这句承诺很容易心动。我的判断要说得直接一点:这类产品解决的问题,和它宣称的安全,是两回事。用老本行的话讲,这叫偷换概念。

拆开看,它做了什么

先看技术实现。把文档里的姓名换成代号、另存一张还原对照表,这个动作本身不需要任何人工智能——它就是一个查找替换脚本,配上正则表达式和一份词典,在任何一台电脑上本地就能跑完。这类网站后台大概率就是这么一个脚本。

真正值得注意的动作发生在脚本之前:上传。你的原始文档完整地离开了你的电脑,进入别人的服务器。从这一刻起,材料已经出了本机。

“泄密”的定义,不是“进大模型”

宣传语聪明的地方,在于它悄悄给“泄密”换了一个定义。

按这套宣传的逻辑,只要数据没被用于训练大模型,就是安全的。但对我们这行来说,泄密的判断标准从来不是“进没进大模型”,而是“出没出你的控制范围”。案卷材料上传到第三方服务器的那一刻,无论服务器后面接的是大模型、是数据库,还是一块没人碰的硬盘,风险结构已经形成:材料在别人的控制之下,你不再知道谁能看到它、会被存多久、之后会被拿去做什么。

“不进大模型”可能是真的。但它承诺的安全,和你关心的安全,不是同一件事。

换成合同的语言看

律师对这种表述结构应该很熟悉。合同谈判里常见的套路之一,就是把一个宽的定义偷换成一个窄的定义:对方只对你最担心的那一小部分做承诺,对更大部分只字不提,然后让你产生“整体都安全”的印象。

“保证 100% 不进大模型”就是同一个结构。它把“数据离开你的控制”这个宽概念,偷换成“数据进入大模型”这个窄概念,然后只对窄的部分做承诺。承诺可能是真的,但宽的那部分——上传行为本身带来的全部风险——恰好被这句话遮住了。

三个判断问题

以后再看到任何“安全脱敏”产品,问三个问题就够了。

一,我的数据在哪里被处理?能接受的答案只有一个:我的电脑。

二,我需要上传什么?只要这个问题的答案不是“什么都不用传”,宣传语就不用再看了。

三,出了事谁负责?去读服务条款,免责条款通常已经写好。

三个问题问完,市面上大部分“在线脱敏”服务就可以放下了。真实的需求完全可以本地解决:有结构规律的字段交给脚本批量替换,人名和项目名配一份对照字典,本地部署的小模型甚至能帮你把字典提炼出来。全流程数据不出本机,技术上是成熟的,不需要向任何人上传任何东西。

结语

安全产品,自己先要经得起安全审视。一句听起来最安全的承诺,把风险最大的动作描述得理所当然——这样的设计,比明目张胆的不安全更值得警惕。


作者简介: 陈石律师(主页 chenshi.ai),浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办“首宗百亿地王”“长春第一高楼”“台州第一高楼”等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。