把项目拆成“机器可判定”和“必须人工判断”两层,只让自动评分处理前者,是防止替代的基本做法。具体操作是:先为每个项目写出判定所需的最小证据,再检查这些证据能否被现有工具稳定读取;不能读取的,就保留人工复核,而不是给它一个看似精确的分数。这样做的直接结果是,自动评分不再覆盖全部项目,人工判断也不会退化成给机器结果盖章。
自动评分替代人工判断,通常不是一步到位的,而是从那些“有数字可用”的项目开始。比如页面是否包含某个词、词出现在第几段、标题字数是否在某个区间,这些都能被程序读出,于是很容易被纳入评分。问题在于,这些数字和项目真正要判断的东西之间,往往隔着语义和语境。
可以用一个假设例子说明。假设某批项目要求判断“页面是否正面回答了用户问题”。程序可以统计问句数量、段落长度、是否出现疑问词,但无法判断回答是否切题。如果把这些统计量加权成一个分数,分数高的页面未必回答得好。此时正确的动作不是调权重,而是把“是否切题”移出自动评分,改由人工按一份简短标准逐条判断。
判断某项目该不该保留人工,可以问三个问题:判定结论是否依赖语义理解;同一份内容换一种表达,结论是否会改变;出现争议时,能否用可核对的证据解释理由。三个问题中有一个答案是“是”,就应保留人工环节。
面对一个正在被自动评分覆盖的项目,处理方式不止一种,但每种都有前提。
三种取舍不是按项目数量平均分配,而是按证据可得性分配。能拿到稳定证据的项目交给机器,拿不到的留给人工。
出现与直觉相反的结果时,常见的两种解释是:工具读取失败,或者项目定义本身模糊。两者的处理方向完全不同,需要先区分。
可以按下面的顺序核对:
这里有一个容易误判的地方:某项统计归零或大幅下降,不能单独证明自动评分处理正确。它也可能是抓取失败、样本变化或项目范围调整造成的。要证明处理正确,需要同时看到人工复核的一致性提高,而不只是某个数字变化。
如果人工判断只出现在流程末端,它的作用往往变成确认自动评分的结果,而不是独立判断。更稳妥的做法是把复核点前移:在自动评分生成之前,先由人工确定判定标准和证据类型;在评分生成之后,只对触发条件的项目做复核。
触发条件可以按影响程度设置,例如结论会直接改变下一步动作的项目必须复核,仅用于内部参考的项目可以抽样。这样安排的结果是,人工时间集中在真正影响决策的地方,自动评分承担的是筛选和排序,而不是最终裁决。
需要提醒的是,不同工具的读取范围和判定逻辑并不相同,具体能力需要以实际测试为准。在把任何自动评分接入正式流程之前,先用一批已知答案的项目做对照,是成本较低且能暴露问题的做法。
把人工判断留在它不可替代的位置,自动评分才不会悄悄变成最终裁决者。