纠正 AI 评估中评分者效应的人类标签:项目反应理论方法
人工智能
2026-02-27 v1 机器学习
摘要
人类评估在训练和评估 AI 模型中占据核心地位,但这些数据几乎不被视作受系统性误差影响的测量。本文将心理测量中的评分者模型集成到 AI 流程中,以提高从人类判断中得出结论的可靠性和效度。该文综述了常见的评分者效应——严重程度和中心性——这些效应会扭曲观察到的评分,并演示如何通过项目反应理论评分模型(特别是多维尺度模型)分离真实输出质量与评分者行为。以 OpenAI 摘要数据集为实证案例,我们展示在调整评分者严重程度后,如何获得摘要质量的校正估计,并提供对评分者表现的诊断性见解。将心理测量建模纳入人类在回环中的评估,提供了更原则、更透明地使用人类数据的方法,使开发者能够基于调整后的分数而非原始、易受误差影响的评分做出决策。本篇观点凸显了一条通向更稳健、更可解释、更贴合构建假设实践的 AI 发展与评估之路。
引用
@article{arxiv.2602.22585,
title = {Correcting Human Labels for Rater Effects in AI Evaluation: An Item Response Theory Approach},
author = {Jodi M. Casabianca and Maggie Beiting-Parrish},
journal= {arXiv preprint arXiv:2602.22585},
year = {2026}
}
备注
16 pages, 5 figures, 1 table; The 16th Annual Learning Analytics and Knowledge Conference (LAK) Workshop on LLM Psychometrics, April 27, 2026, Bergen, Norway