Jev系列 · 第 3 篇

核心概念:RLCD 与置信度

返回列表

这一篇是全系列的原理核心。理解了 RLCD 和置信度校准,你就明白了 Jev 和其他模型的本质区别——不需要数学基础,用例子讲。

从一个例子说起:为什么"快"的模型必须"诚实"

假设一个自动化系统要判断:用户上传的内容是否违规。

  • 模型 A 回答"违规",实际错了 30%,但每次都斩钉截铁;
  • 模型 B 回答"违规,置信度 72%",错了的时候置信度通常也低。

如果你只能自动执行模型的判断,模型 B 显然安全得多:置信度低于阈值就转人工。这就是 TypeSafe AI 强调的 calibrated decisions(校准的决策)——模型不仅要对,还要知道自己有多对

RLCD:用"对比"练出直觉

先解释缩写:RL = Reinforcement Learning(强化学习)——不给标准答案,只靠"好行为加分、坏行为减分"的反馈信号让模型自己试错学习,就像训练小狗做对了给零食(想深入看《强化学习是什么》)。这类缩写都是 RL from X 模式:RLHF 的 X 是人类反馈,RLVR 的 X 是可验证答案,而 RLCD 的 X 是——

RLCD(Reinforcement Learning from Contrastive Distillation,对比蒸馏强化学习)的训练思路是构造对比对:

  1. 对同一个决策场景,写出两个输出:一个是好判断(考虑了关键风险、结论正确),一个是坏判断(鲁莽、忽略重要信息);
  2. 让模型看到这两个样本,向"好的"靠拢、远离"坏的";
  3. 海量重复后,模型形成的是决策直觉——不需要写思维链,一次前向计算就能给出靠谱的判断。

它和 RLHF 的区别:

RLHFRLCD
训练信号人类对回答打分排序结构化的好/坏对比样本
信号来源主观偏好可清晰定义对错的决策场景
产出会聊天的模型会校准决策的模型

为什么一次前向就够

传统观点认为复杂判断必须靠思维链(写一大段推理过程)。RLCD 的思路是:把"思考"提前放到训练阶段——训练时通过对比样本把判断模式蒸馏进模型,推理时就不需要再逐步推理了。

代价是训练成本高、灵活性低(场景变了要重新构造样本);换来的是推理时的低延迟、低成本、高吞吐("一次前向计算"是怎么回事,见《前向计算是什么》)。对于一天要跑百万次判断的自动化系统,这笔账很划算。

置信度:自动化系统最需要的输出

Jev 这类决策模型的输出不只是"结论",还有置信度。工程上通常这样用:

  • 置信度 ≥ 90%:自动执行;
  • 置信度 60% - 90%:抽样人工复核;
  • 置信度 < 60%:转人工或升级到 System 2 模型慢推理。

这套分级处理是自动化决策系统的骨架,05 篇实战会具体设计它。

小结

  • RLCD = 用对比样本把"会思考"蒸馏成"有直觉";
  • 置信度校准 = 模型对不确定的判断要诚实;
  • 两者的组合让"模型在软件里做决策"变得工程上可行。

下一篇进入实战:用这个思路完成你的第一个决策任务。