豆包、Kimi、DeepSeek、元宝、Cherry Studio、WorkBuddy、Claude Code、Codex……AI 工具的名字每周都在变多。但剥掉皮看骨架,它们其实只有四代形态。
这篇给你一张地图。以后每冒出一个新工具,你十秒钟就知道该往哪格放、该向它要什么。
为什么需要这张地图
工具焦虑的根源,是把每一张皮都当成一个新物种。今天听说 WorkBuddy 火,赶紧装一个;明天听说 Codex 强,又去追一个。追到最后,电脑里装了十几个 AI,每个都只会用最表面那层功能。
看清代际,焦虑会消失大半——因为你会发现,很多"新产品"只是同一个东西换了张皮。
第一代:chatbot,一个脑子极好的"植物人"
网页版豆包、Kimi、DeepSeek,以及 ChatGPT 的"聊天"模式。
特征是:只有一个对话框,没有手脚。它不能读你电脑里的文件,不能在你的硬盘上建文档,更不能改你的文件。它唯一的动作,是基于你的输入生成回答。
而且它被封装得很死:温度、上下文、最大输出长度,这些参数你都调不了。你只能聊天。
"植物人"这个比喻可能有点冒犯,但它精确:脑子极好,手抬不起来。你可以从它脑子里提取很多东西,但它没法替你干活。
第二代:工作台,给脑子配上工具
Cherry Studio 是代表。它还围着对话框转,但开放了封装:
- 温度值:控制输出严谨还是发散。法律类任务建议调到 0.3 以下,头脑风暴可以调高。
- 上下文轮数:每次对话带多少历史。带得多,回答更连贯,但 token 消耗也成倍翻。
- 最大输出 token:chatbot 把这个锁死在几千,所以再复杂的案件它也只能给你"缩写版";工作台可以调到几万,长文书才写得出来。
- 预设提示词:这是工作台最核心的能力——预先定义"这个助手是干什么的、按什么步骤干、产出什么格式"。
预设提示词值得单独说。大模型什么都会,这恰恰是要命的:不给边界,产出必然漂移。预设提示词就是给它划一个窄边界,让它在边界里稳定地重复干一件事。所谓"助手",说到底就是一条边界。
第三代:场景 agent,长出"手脚"
WorkBuddy 是代表。聊天框还在,但框的背后长出了手脚:它能读你电脑里的文件,能在你的文件夹里建几十份文档,能按规则整理你乱糟糟的桌面。你跟它的关系,从"问问题"变成了"布置作业"。
WorkBuddy 的构造思路很能说明问题:底层是腾讯的 agent 基座 CodeBuddy,上面把工作场景的资源——技能、专家、连接器、知识库——集成到一张面板上。公开报道里,它的第一个原型是产品负责人汪晟杰和几名核心成员用一个周末做出来的。基座早就存在,"工作"这层皮 48 小时就搭完了。
这反过来证明一件事:皮好做,基座难做。明天完全可能有 LegalBuddy、FamilyBuddy 冒出来,底层都是同一个东西。而你要学的,从来不是某张皮,是基座的逻辑。
第四代:通用 agent,液态机器人
Claude Code、Codex 是代表。它连场景都不预设:你不用先告诉它"你是干什么的",直接提要求,它自己分析意图、拆解任务、制定计划、调用工具,现场组装出完成任务所需的能力。
《终结者》里的液态机器人 T-1000 是最形象的类比:没有固定形态,全身组件随任务变换。这是 agent 的原生形态——前三代,都是在它外面套了不同厚度的皮。
一个底层等式:皮不同,逻辑同构
四代放在一起看,结论只有一句话:所有这些软件,都是"调用大模型,并用代码对模型做结构化控制"的组件。chatbot 控制得最死,agent 控制得最活。
皮千差万别,逻辑是同构的。所以新工具出来的时候,别问"它叫什么",问两个问题:它把模型控制到了什么程度?它给我留了多少控制空间?这两个问题的答案,决定它在你工作里的位置。
一条辩证曲线:自由度越大,失控概率越高
这是地图上最容易被忽略的一条线。从 chatbot 到 agent,开放给你的自定义空间一路变大——但模型的自由度也在变大,不确定性跟着变大。三个推论:
新手反而该从 chatbot 起步。 agent 慢,是因为它要分析意图、规划步骤、调用工具。不懂这个,你会嫌它慢,回头用 chatbot,还觉得更快更好。
快不等于好,流畅也不等于好。 任何模型的输出,逻辑性都很好——在你还没有业务识别力的时候,"逻辑顺"最容易被误当成"质量高"。
大不等于好。 你以为给它的数据库越大越好,但超出上下文窗口的部分,模型根本读不到,等于不存在。
四个常见误区(错了会怎样)
- 在 chatbot 里要长文书。 输出被锁死,它只能把判决书压缩成"宏观概括版",颗粒度粗得没法用。
- 把回答快当能力强。 快的往往只是省掉了规划和验证。
- 一上来就用最高自由度的工具。 失控概率最高,而你还不知道怎么收。
- 追每一个新工具。 皮追不完,逻辑一套就够。
适用边界
这张地图是 2026 年年中的一张快照。产品迭代极快,形态也在融合——Cherry Studio 后来加了 agent 功能,ChatGPT 的"工作"标签其实就是场景 agent。地图的价值不在记名词,在于你拿到任何新工具时,能迅速定位它在哪一格,知道它能干什么、不能干什么。
我在《赋能法律人》里写过一个观点:法律人用 AI,重点从来不是追工具,是理解工具对模型的控制逻辑。这张地图,就是那句话的展开。
作者简介: 陈石律师,浙江海泰律师事务所副主任、高级合伙人、房地产与建设工程部主任,宁波市律师协会副秘书长、第七届宁波仲裁委员会仲裁员,聚焦建筑房地产、投融资、并购重组及商事争议解决。曾获多家法律媒体与专业机构认可,荣登 LegalOne 2025 中国区建工及房地产实务先锋 45 强、律新社 2025 年度管理合伙人 20 佳(华东),入选《商法》The A-List 法律精英,获评 ALB China 区域市场十五佳长三角地区律师新星,并获律新社 2024 年度并购领域品牌之星。长期为万科、华润置地、信达地产、保利置业、招商蛇口、中海地产等企业提供法律服务,承办"首宗百亿地王""长春第一高楼""台州第一高楼"等代表性项目,累计服务项目投资额超千亿。近年来持续推动 AI 与法律实务融合,强调以结构化方法打通技术逻辑、法律判断与商业场景;著有《赋能法律人:AI 底层思维与应用范式》,并在多地开展相关主题讲座与分享。四明山法师 AI 夜校(legalAGI.cn)发起人。