GMT+8 SG --:-- 0000 X 0000 Y /
← 全部文章← All writing

AI 战略

不是每个判断都该惊动大模型

过去几年,AI 行业形成了一种很强的路径依赖:只要一个问题需要「智能」,就调大模型。

分类,调 GPT。抽取,调 GPT。RAG 重排,调 GPT。Text2SQL,调 GPT。Agent 选工具,调 GPT。判断结果对不对,还是调 GPT。

模型越来越强,我们也越来越习惯把所有问题塞进同一个 Prompt。但我越来越觉得,这只是大模型早期的一个过渡状态。

我们在用 CEO 决定邮件该转给谁

以 Text2SQL 为例。用户问一句「2025 年 Acme 在亚洲交付了多少台 X-700」,系统要做的事其实很多:

识别「Acme」和「X-700」对应哪些实体,判断该查哪几张表,选哪些字段,确定表怎么 Join,生成 SQL,再检查这条 SQL 是不是真的回答了刚才那个问题。

今天最省事的做法是全都交给大模型。它确实做得了。但值得问一句:这些任务需要的是同一种智能吗?

  • 这 20 张表里该选哪三张?
  • Acme 和 Acme Industries 是不是同一个实体?
  • 这 50 段资料里哪 5 段和问题最相关?
  • 这个请求该走 Search、Text2SQL 还是知识图谱?
  • SQL A、B、C 哪个更可能是对的?

这些问题本质上是同一类:**判断、选择、排序、打分。**它们不需要模型写文章,也不需要长链条推理。

让一个几千亿参数的通用模型来做这些,就像公司里无论是决定一封邮件转给哪个部门,还是定五年战略,都去找 CEO。当然可以。但一定不是最优的组织方式。

Jev 真正的变化不是快

TypeSafe 最近发布的 Jev 让我更认真地想这件事。它没有试图再做一个 GPT,甚至不以生成语言为目标。官方给它的定位是「第一个 System One 模型」——做出软件可以直接使用的快速结构化判断,而不是产出给人读的文字。

它的接口只有三个原语:

原语 问的问题 返回
Choice 从一组选项里选一个 选项、概率分布、置信度
Score 按一个 rubric 给状态打分 分数、概率分布、置信度
Noul 这句陈述为真吗 一个 0 到 1 的值

你给它一个 state,再对这个 state 提一组带类型的问题,它直接返回结构化结果。**没有文本生成,也就没有解析。**官方的说法是,你不必再「把一个文本生成系统硬掰成输出结构化判断,然后把结果解析回代码能依赖的东西」。

乍看不性感——分类模型几十年前就有了。但真正的变化在于任务是怎么被定义的。

传统机器学习时代,要判断一篇新闻属于「交付」「并购」「事故」还是「新产品」,你得收数据、标注、训练、评估、部署;业务规则一变,可能要重训一遍。而现在,同一个模型今天可以被问「这篇新闻属于以下哪一类」,明天被问「这篇新闻值不值得推给一线销售」。模型没换,任务换了。

**任务定义从训练时搬到了调用时。**这是我认为真正重要的那一点。

它的文档里还有一条建议我很认同:复杂判断应该拆成一组原子问题,在代码里组合,而不是在一个 Prompt 里要求模型把整条推理链走完。

AI 正在重复计算机的历史

我们过去几年其实把两件事混在了一起:语言智能通用智能。因为 GPT 最初以语言模型的形式出现,而语言又恰好能表达几乎所有问题,我们就很自然地认为,所有智能任务都该经过语言生成。

但一个系统真正需要的智能有好几种。这是什么?哪个更相关?下一步去哪?这个结果可靠吗?以及——面对一个从没见过的复杂问题,我该怎么理解它、拆解它、解决它?

只有最后一种,才是 frontier model 真正该出场的地方。

这让我想到计算机。今天没有人问「CPU 会不会最终干掉 GPU」,因为这个问题本身不成立:它们处理的是不同类型的计算。图形和大规模并行给 GPU,通用控制逻辑给 CPU,视频编解码有专门模块,网络也有专门硬件。

现代计算机强大的原因,不是我们造出了一颗无所不能的处理器,恰恰是我们接受了不同的计算该由不同的硬件来做。

AI 很可能会走同一条路。一个成熟的 AI 系统大概是这样分工的:

组件 负责
Frontier LLM 复杂推理、规划、开放问题、异常处理
Decision Model 分类、打分、路由、重排、验证
Embedding 大规模语义召回
视觉 / 语音模型 各自的模态
搜索引擎 连接实时世界
数据库 / 知识图谱 确定性的事实与关系
传统软件 所有根本不需要概率智能的事

这些东西加起来,才是完整的 AI。这就是我理解的异构智能

GPT 的位置会更高,调用会更少

这不意味着 GPT 变得不重要。恰恰相反,我认为它在系统里的位置会越来越高,只是调用次数未必越来越多。

今天一个 Agent 完成一次复杂任务,可能调十次 GPT。未来可能是:调二十次 Decision Model,查五次数据库,搜三次互联网,跑几个传统程序,调几个小模型,最后只调一次最强的那个。

而这一次,它负责的是理解真正的目标、制定计划、处理不确定性、解决别的模块解决不了的问题、综合全系统拿到的信息,然后给出最终回答。

**GPT 从「什么都亲自做」,变成真正意义上的大脑。**调用次数下降,不代表战略重要性下降——就像 GPU 普及之后 CPU 并没有消失,它只是不用再亲自做所有计算。

被挑战的不是 GPT,是「调一次 API = AI 功能」

所以 Jev 这类模型真正挑战的不是 GPT,而是过去几年形成的一种开发范式:

AI 功能 = 调一次 LLM API。

这个阶段可能正在结束。未来设计 AI 产品时,第一个问题不该再是「这里用 GPT 还是 Claude」,而该是:这个环节到底需要哪一种智能?

需要检索就用检索,需要判断就用判断模型,需要实时事实就用搜索,需要精确计算就用代码,需要结构化事实就用数据库和知识图谱。只有真正面对复杂、未知、开放的问题时,才调那个最强的。

从模型智能到系统智能

过去几年整个行业最关心的问题是「哪个模型最聪明」——GPT、Claude、Gemini,谁的 benchmark 高两分。

但企业真正关心的从来不是这个。企业关心的是:完成一个真实任务要多少钱、多少时间,结果可不可靠,能不能规模化跑起来。

到那个时候,竞争的基本单位就不再是一个模型,而是一整套智能系统。行业会从 Model Intelligence 走向 System Intelligence

真正好的 AI 产品,不一定用了世界上最强的模型,而是在每一个环节都选对了成本、速度和能力最匹配的那一种智能。

我们一直在等一个越来越强的模型:参数更多,context 更长,推理更深,benchmark 更高,最终无所不能。这条路线当然会继续。但从工程的角度看,另一条路线同样重要——不是让一个模型越来越万能,而是让整个系统越来越聪明。

未来真正强的 AI,可能不是一个模型,而是一群完全不同的智能模块:有的思考,有的判断,有的寻找,有的记忆,有的执行,有的验证。就像今天的计算机不是一颗芯片,而是一整套计算体系。

**大模型不是 AI 的最终形态,它只是异构智能系统里最重要的那一个组成部分。**下一场竞争,也许会从「谁拥有最强的模型」,转向「谁能搭出最高效、最可靠、成本最低的智能系统」。

这可能才是 Agent 真正开始成熟的标志。