Jev系列 · 第 4 篇

第一次实战:做一个分类决策

返回列表

原理讲完了,这一篇动手。我们以最常见的场景——文本分类决策(以客服工单自动分类为例)——走完一遍决策任务的完整设计流程。跟着做完,你就掌握了使用决策模型的基本功。

明确任务

假设你每天收到 500 条客服工单,需要分成四类:咨询投诉退款技术故障,人工分一遍要两小时。目标:让模型自动分,拿不准的转人工。

第一步:写清晰的类别定义

决策模型的第一准则:类别边界清晰,模型才有校准的余地。别只写四个词,把每类的判断标准写出来:

  • 咨询:询问产品功能、价格、使用方法,不需要立即解决问题;
  • 投诉:对已发生的服务/体验表达不满,情绪词明显;
  • 退款:明确要求退钱、取消订单,或提及退款政策;
  • 技术故障:描述无法使用、报错、崩溃等功能问题。

注意:一条工单可能同时像"投诉"和"技术故障",规则要写清楚优先级(如:提及退款要求的一律归退款)。

第二步:构造对比样本(RLCD 思想的实际应用)

即使暂时只用 Playground 手测,也可以按 RLCD 的思路准备正反例

好判断的例子(模型该学成的样子):

输入:"你们这个 APP 根本登录不上,验证码收不到,我要退款!" 判断:退款(置信度高)——理由:明确提及退款要求,按优先级规则归退款。

坏判断的例子(模型该避免的):

判断:技术故障(置信度高)——只看到了登录问题,忽略了"我要退款"这个明确诉求。

把这类正反例各准备 5-10 组,覆盖容易混淆的边界情况。它们既是你测试模型的手风琴,也是未来微调/优化提示词的素材库。

第三步:小批量测试

在 Playground 里跑 30-50 条真实工单(敏感信息先脱敏),记录三个数:

  1. 准确率:和人工分类对比,对了多少;
  2. 置信度分布:模型给出的置信度是不是"高的时候真的准";
  3. 错在哪里:错的样本集中在本地的哪个类别边界上。

如果 90% 以上的样本置信度落在两端(很高或很低),说明模型校准得不错,中间灰色的部分就是该转人工的。

第四步:设计分级处理规则

根据测试结果定阈值(数字先用起来,再逐步调):

  • 置信度 ≥ 0.9 → 自动分类,直接进对应处理队列;
  • 0.6 - 0.9 → 自动分类 + 每天抽样 20% 人工复核;
  • < 0.6 → 进入人工分类队列。

这一步做完,你的第一个决策自动化就成立了:两小时的人工活,变成"模型跑一遍 + 处理少量灰色地带"。

常见坑

  • 类别定义含糊:模型只能给出低置信度,问题不在模型在你的规则;
  • 测试集不真实:用编造的工单测试结果很好,真实数据一上就崩——一定用真实(脱敏后的)样本;
  • 阈值一步到位:阈值要随复核结果迭代,别指望第一次就定准。

下一篇我们把这个任务放进真实的自动化流程,讲工程化的架构设计。