强化学习是什么:AI 是怎么"自学成才"的
返回列表看 AI 新闻总会撞上一串缩写:RLHF、RLVR、RLCD……开头都是 RL = Reinforcement Learning(强化学习)。这篇文章把 RL 本身讲明白,之后再看这些缩写就一目了然了。
一句话定义
强化学习 = 不给标准答案,只给反馈信号,让模型在海量试错中自己学会"怎么做才好"。
从训练小狗说起
训练小狗握手,没有人给它一本《握手原理》,流程是:
- 小狗随便动(试错);
- 碰巧抬了爪子 → 给零食(奖励);
- 做错了 → 没有零食(惩罚,其实就是没有奖励);
- 千百次之后,小狗"强化"出了握手的行为。
强化学习训练模型就是这个流程:模型输出行为 → 环境给出奖励或惩罚 → 调整参数让高奖励的行为更可能出现 → 重复亿万次。
和"看答案学习"有什么不同
AI 训练主要有两条路,对比一下就清楚 RL 的特殊之处:
| 监督学习(看答案学) | 强化学习(试错学) | |
|---|---|---|
| 给模型什么 | 标准答案:"输入 A 应输出 B" | 只给反馈:"这个输出好 / 不好" |
| 模型学到的 | 模仿答案 | 追求结果好 |
| 适合的任务 | 答案唯一且明确 | 好坏好判断、但"正确做法"说不清 |
比如"写一首好诗"没有唯一标准答案,没法标"标准答案",但人能感觉出哪首更好——这种任务就该用强化学习:让模型写,按好坏给反馈,慢慢就写出人喜欢的样子了。
三个核心要素
所有强化学习系统都绕不开这三样:
- 状态(State):当前面对什么情况——模型看到的输入;
- 动作(Action):可以选择的做法——模型输出的内容;
- 奖励(Reward):这个做法好不好——反馈信号。
设计强化学习,本质上就是设计这个奖励:奖励定得好,模型学出好行为;奖励定歪了,模型会钻空子(比如写作任务只奖励"字数多",它就学会灌水)。这是强化学习最核心的工程难题。
大模型训练里的位置
一个现代大模型的成长分三个阶段,RL 是最后一步:
1. 预训练:海量文本"背书",学会语言规律(像读完了整个图书馆)
2. 监督微调(SFT):看高质量问答范例,学会"对话的格式"(像看例题)
3. 强化学习:按人类偏好/任务反馈打磨,学会"回答得好"(像真正上场练习)
ChatGPT 类模型之所以"会聊天"而不只是"会续写",关键就在第三步。
RL from X:一个公式看懂那串缩写
主流缩写全是 RL from X 模式——都是强化学习,区别只在奖励信号从哪来:
| 缩写 | 全称 | 反馈来源 | 产出 |
|---|---|---|---|
| RLHF | Reinforcement Learning from Human Feedback | 人类反馈(人工打分排序) | 会聊天的模型(ChatGPT 这一代) |
| RLVR | Reinforcement Learning from Verifiable Rewards | 可验证奖励(数学对错、代码跑不跑得通) | 推理模型 |
| RLCD | Reinforcement Learning from Contrastive Distillation | 对比样本(好判断 vs 坏判断) | 会校准决策的模型(Jev 走的路线) |
以后再遇到新缩写,先问一句"它的 X 是什么",就知道这个模型是拿什么反馈练出来的。
实用理解
- RL 教的是能力和偏好,不是知识——知识主要靠预训练阶段灌进去;
- 奖励设计决定模型行为:你看到的模型怪癖(回答冗长、过度免责),几乎都是奖励设计歪了的结果;
- 判断一个新模型,看它的 RL 反馈来源,比看参数量更能说明它"擅长什么"。
延伸阅读
一句话总结
强化学习 = 不教答案,只给好坏反馈,让模型在试错中自己长出能力——奖励设计得对,模型才能学得正。