我们的主动式智能体做过一件事,值得完整讲一遍。
它每天扫全球飞行数据找异常。某天它标记出一家合作运营商:过去一个月的飞行量断崖式下跌。没有任何外部新闻触发这次检查——它不是读到了什么才去查,是在没人提问的情况下自己发现的。系统跑了多轮核验,排除掉季节性、机队调整、数据缺报这些常见解释,最后判定为经营异常,把它推给了管理层。
几周后,业务侧有一个欧洲航班要执行。因为此前有过合作,采购顺理成章地选了这家运营商,定金已付。
到付尾款那一步,系统把这笔付款拦住了——它带着那条风险标记。核实下来:这家运营商的 AOC 已被吊销,正处于监管调查中。
这一次拦截,避免了约五十万美元的直接损失。还避免了另一件更难挽回的事:如果款付了、航班没了,客户会在到达机场的那一刻才知道飞机不在。
但真正起作用的不是那条洞察
这个故事最容易得出的结论是「我们的主动洞察很准」。我认为那是错的结论。
同样一条判断,如果只是出现在管理层的看板上,结局大概率是这样:有人看到了,觉得有道理,甚至转发了一下。三周后采购走流程,没人把这条记忆和这笔付款联系起来,钱照付。
那条洞察本身没有创造价值。创造价值的是它被接在了一个能拦住付款的地方。
这不是文字游戏。它决定了你该在哪里投入工程。
三个层次,大多数人停在第二层
主动智能的落地程度可以分成三层:
**第一层:看得到。**洞察进了看板、进了日报、进了周会 PPT。它的命运取决于有没有人恰好在正确的时间看到正确的那一条。绝大多数「AI 洞察」产品停在这里,而且它们的指标通常是产出量——今天生成了多少条。
**第二层:会被推送。**洞察主动找人,进了群、进了邮件、进了通知栏。比第一层强,但它仍然只是把「有没有人看到」的概率提高了一点。人可以已读不回,可以看到了但当时不在做那件事,可以三周后忘掉。
**第三层:能拦住。**洞察不再是一条消息,是一个挂在业务链路上的状态。付款走到这里,它必须先问一句这个对手方有没有风险标记。人不需要记得,因为流程本身记得。
第三层和前两层的区别,不是「更主动」,是这条判断有没有权力说「不」。
前两层的价值上限,是「有人恰好想起来」。第三层的价值上限,是这条链路本身的金额。
代价:拿到权力之前,先得配得上它
第三层不是免费的。一条能拦住付款的判断,也意味着它误判的时候会拦住真实业务。
所以顺序不能反。那些看起来像镀金的工程——多轮核验、排除季节性和机队调整这些常见解释、把不确定的情形标成「需人工确认」而不是「拦截」——不是为了让洞察更漂亮,是买进入支付链路的门票。
一个没有经过这种验证的系统,绝不该被接到控制点上。它会在两周内制造出足够多的误拦,然后被永久降级回第一层——而且这次是人主动把它关掉的。
这条因果我写在别处也说过:主动洞察的真正工程量不在生成内容,在判断「这一刻值不值得打扰」。接到控制点上之后,这句话要改得更重:在判断这一刻值不值得叫停。
边界:不是所有判断都该硬拦
把所有洞察都做成硬拦截,是另一种失败。
判据是两个:这个动作可不可逆,以及拦错了的代价有多大。
- 付一笔不可退的尾款 → 不可逆、金额大 → 硬拦,人工复核后才放行
- 把一个线索分给某个销售 → 可逆、代价小 → 提示即可,不必挡路
- 给客户发一封推荐邮件 → 半可逆(发出去收不回,但代价有限)→ 软拦,默认暂停但允许一键继续
**同一套判断,按下游动作的可逆性分级落地。**这件事和给 Agent 授权写操作是同一条规矩——高风险动作必须有人确认,低风险动作不该每次都惊动人。
所以
如果你在做主动式智能体,有一个问题比「我们的洞察准不准」更值得先问:
这条判断,最终能让什么事情停下来?
如果答案是「它会出现在一个页面上」,那不管模型多强、核验多严,它的天花板已经定了——它是一条通知。通知的价值取决于读者的记性,而记性是这个系统里最不可靠的部件。