一条内容生产线一旦交给模型,产量就不再是问题了。可信才是。
而最贵的错误从来不是那种一眼假的。是看起来完全正确的那种:口径混用、单位漂移、把季节性说成增长、引用一个在证据里根本找不到的数字。这些东西读起来通顺、专业、有理有据,只有懂行的人在第三遍才会停下来。
所以门要设,但设在哪儿、设几道、谁来把,是有讲究的。
三层,顺序不能换
**第一层:确定性规则。**能用代码判定的,绝不交给模型。数字能不能在引用的证据里原样找到?单位对不对?时间范围有没有跨口径?实体是不是系统里真实存在的那一个?
这些判断没有模糊地带,跑一次几毫秒,还不会有情绪。把它们放在最前面,是为了不让后面昂贵的评审浪费在低级问题上。
**第二层:多模型评审。**过不了确定性规则的直接退回;过了的,才值得让模型看一眼那些真正需要判断的东西——这个结论站得住吗?这个因果说得过去吗?语气有没有越界?
关键是评审者不能是生成者。共用同一段上下文,评估会系统性偏宽。
**第三层:人。**一个审核台,左边原文右边字段,逐条确认才入库。初期全量人工,用几周把质检规则喂熟,再逐步让机器接管前面的部分。
顺序反过来就完蛋:先上模型评审、再补规则,你会为一堆本可以用一行代码挡掉的问题付推理费。
门是用来削长尾的,不是用来改主体的
这是我觉得最容易被误解的一点。
一道门如果显著改变了系统输出的主体——也就是大部分正常结果都被它改了——那不是门的问题,是上游的问题,应该回去改提示词、改工具、改数据。门在这时候只是在掩盖病灶。
门该干的是削掉那条长尾:千分之几的离谱输出、幻觉数字、越界表达。它对平均质量几乎没有贡献,它的全部价值在于让最差的那几次不要发生。
判断一道门是否健康,看它的拦截率。长期高拦截说明上游坏了;长期零拦截说明它形同虚设。
生成时放行,发布时卡死
同一套内容,在不同阶段应该有完全不同的严格度。
**生成阶段 fail open。**草稿、中间结果、给自己看的东西,门要宽。这时候误杀的代价远大于漏过——一个被卡住的草稿等于一次白跑的推理,而它本来就还要被人改。
**发布阶段 fail closed。**一旦这东西要出现在用户面前、要被引用、要进数据库,门要严到宁可不发。这时候漏过的代价远大于误杀。
很多系统的问题是全程用同一个阈值:要么早期太严,把探索空间掐死;要么末期太松,让长尾直接见用户。
几条具体的门
从实际跑的系统里挑几条,它们都很土,但都拦住过真东西:
- **数字核查。**产出里出现的每个金额、数量、百分比,必须能在引用的证据里找到一致的值。找不到就退回,不许「大约」。
- **实质变化闸。**如果这一轮的数据相对上一轮没有实质变化,这个话题直接冷却,不生成。否则系统会为了产出而产出,制造出「本周持平」这类零信息内容。
- **话题疲劳。**按语义归并最近讲过的话题,冷却期内不再出现。防的是换个说法把同一件事讲三遍。
- **红线指标。**不设 KPI 目标,只设红线:纠错率、撤稿率、边界外内容漏出率。这些数字不用来考核,用来叫停。
边界
**门不产生质量,它只防止质量事故。**一个平庸的系统加一百道门,产出仍然平庸,只是不会出丑。真正的提升永远来自上游。
**人工那一层不能永远是人工。**审核台的目的不是长期养一支审核队伍,是采集高质量的判断样本——什么该过、什么不该过、为什么。这批标注才是让机器逐步接管的燃料。如果一年之后人还在做同样比例的活,那这道门设计失败了。