强化学习是什么:AI 是怎么"自学成才"的

返回列表

看 AI 新闻总会撞上一串缩写:RLHF、RLVR、RLCD……开头都是 RL = Reinforcement Learning(强化学习)。这篇文章把 RL 本身讲明白,之后再看这些缩写就一目了然了。

一句话定义

强化学习 = 不给标准答案,只给反馈信号,让模型在海量试错中自己学会"怎么做才好"。

从训练小狗说起

训练小狗握手,没有人给它一本《握手原理》,流程是:

  1. 小狗随便动(试错);
  2. 碰巧抬了爪子 → 给零食(奖励);
  3. 做错了 → 没有零食(惩罚,其实就是没有奖励);
  4. 千百次之后,小狗"强化"出了握手的行为。

强化学习训练模型就是这个流程:模型输出行为 → 环境给出奖励或惩罚 → 调整参数让高奖励的行为更可能出现 → 重复亿万次。

和"看答案学习"有什么不同

AI 训练主要有两条路,对比一下就清楚 RL 的特殊之处:

监督学习(看答案学)强化学习(试错学)
给模型什么标准答案:"输入 A 应输出 B"只给反馈:"这个输出好 / 不好"
模型学到的模仿答案追求结果好
适合的任务答案唯一且明确好坏好判断、但"正确做法"说不清

比如"写一首好诗"没有唯一标准答案,没法标"标准答案",但人能感觉出哪首更好——这种任务就该用强化学习:让模型写,按好坏给反馈,慢慢就写出人喜欢的样子了。

三个核心要素

所有强化学习系统都绕不开这三样:

  1. 状态(State):当前面对什么情况——模型看到的输入;
  2. 动作(Action):可以选择的做法——模型输出的内容;
  3. 奖励(Reward):这个做法好不好——反馈信号。

设计强化学习,本质上就是设计这个奖励:奖励定得好,模型学出好行为;奖励定歪了,模型会钻空子(比如写作任务只奖励"字数多",它就学会灌水)。这是强化学习最核心的工程难题。

大模型训练里的位置

一个现代大模型的成长分三个阶段,RL 是最后一步:

1. 预训练:海量文本"背书",学会语言规律(像读完了整个图书馆)
2. 监督微调(SFT):看高质量问答范例,学会"对话的格式"(像看例题)
3. 强化学习:按人类偏好/任务反馈打磨,学会"回答得好"(像真正上场练习)

ChatGPT 类模型之所以"会聊天"而不只是"会续写",关键就在第三步。

RL from X:一个公式看懂那串缩写

主流缩写全是 RL from X 模式——都是强化学习,区别只在奖励信号从哪来

缩写全称反馈来源产出
RLHFReinforcement Learning from Human Feedback人类反馈(人工打分排序)会聊天的模型(ChatGPT 这一代)
RLVRReinforcement Learning from Verifiable Rewards可验证奖励(数学对错、代码跑不跑得通)推理模型
RLCDReinforcement Learning from Contrastive Distillation对比样本(好判断 vs 坏判断)会校准决策的模型(Jev 走的路线)

以后再遇到新缩写,先问一句"它的 X 是什么",就知道这个模型是拿什么反馈练出来的。

实用理解

  • RL 教的是能力和偏好,不是知识——知识主要靠预训练阶段灌进去;
  • 奖励设计决定模型行为:你看到的模型怪癖(回答冗长、过度免责),几乎都是奖励设计歪了的结果;
  • 判断一个新模型,看它的 RL 反馈来源,比看参数量更能说明它"擅长什么"。

延伸阅读

一句话总结

强化学习 = 不教答案,只给好坏反馈,让模型在试错中自己长出能力——奖励设计得对,模型才能学得正。