Jev系列 · 第 4 篇
第一次实战:做一个分类决策
返回列表原理讲完了,这一篇动手。我们以最常见的场景——文本分类决策(以客服工单自动分类为例)——走完一遍决策任务的完整设计流程。跟着做完,你就掌握了使用决策模型的基本功。
明确任务
假设你每天收到 500 条客服工单,需要分成四类:咨询、投诉、退款、技术故障,人工分一遍要两小时。目标:让模型自动分,拿不准的转人工。
第一步:写清晰的类别定义
决策模型的第一准则:类别边界清晰,模型才有校准的余地。别只写四个词,把每类的判断标准写出来:
- 咨询:询问产品功能、价格、使用方法,不需要立即解决问题;
- 投诉:对已发生的服务/体验表达不满,情绪词明显;
- 退款:明确要求退钱、取消订单,或提及退款政策;
- 技术故障:描述无法使用、报错、崩溃等功能问题。
注意:一条工单可能同时像"投诉"和"技术故障",规则要写清楚优先级(如:提及退款要求的一律归退款)。
第二步:构造对比样本(RLCD 思想的实际应用)
即使暂时只用 Playground 手测,也可以按 RLCD 的思路准备正反例:
好判断的例子(模型该学成的样子):
输入:"你们这个 APP 根本登录不上,验证码收不到,我要退款!" 判断:退款(置信度高)——理由:明确提及退款要求,按优先级规则归退款。
坏判断的例子(模型该避免的):
判断:技术故障(置信度高)——只看到了登录问题,忽略了"我要退款"这个明确诉求。
把这类正反例各准备 5-10 组,覆盖容易混淆的边界情况。它们既是你测试模型的手风琴,也是未来微调/优化提示词的素材库。
第三步:小批量测试
在 Playground 里跑 30-50 条真实工单(敏感信息先脱敏),记录三个数:
- 准确率:和人工分类对比,对了多少;
- 置信度分布:模型给出的置信度是不是"高的时候真的准";
- 错在哪里:错的样本集中在本地的哪个类别边界上。
如果 90% 以上的样本置信度落在两端(很高或很低),说明模型校准得不错,中间灰色的部分就是该转人工的。
第四步:设计分级处理规则
根据测试结果定阈值(数字先用起来,再逐步调):
- 置信度 ≥ 0.9 → 自动分类,直接进对应处理队列;
- 0.6 - 0.9 → 自动分类 + 每天抽样 20% 人工复核;
- < 0.6 → 进入人工分类队列。
这一步做完,你的第一个决策自动化就成立了:两小时的人工活,变成"模型跑一遍 + 处理少量灰色地带"。
常见坑
- 类别定义含糊:模型只能给出低置信度,问题不在模型在你的规则;
- 测试集不真实:用编造的工单测试结果很好,真实数据一上就崩——一定用真实(脱敏后的)样本;
- 阈值一步到位:阈值要随复核结果迭代,别指望第一次就定准。
下一篇我们把这个任务放进真实的自动化流程,讲工程化的架构设计。