中文

STABLEVAL:面向人工智能系统评估的不敏感方法

机器学习 2026-05-05 v1 人工智能

摘要

人类评估仍是评估现代人工智能系统的主要标准,但标注员之间的 disagreement、偏见和可变性会导致在标准多数投票聚合方法下,系统排名异常脆弱。多数投票会丢弃标注员的可靠性信息以及项目层面的模糊性,往往在不同标注子集之间产生不稳定的比较。我们提出了 STABLEVAL,这是一种面向不敏感评估的框架,通过建模潜在项目正确性和标注员特有的混淆模式,来生成后验期望项目积分和校准后的代理人水平得分。与如 Dawid-Skene 这样的标签去噪方法不同,STABLEVAL 明确设计用于稳定且具备不确定性感知的系统评估,而非硬标签恢复。我们将排名稳定性作为首要的评估目标,分析聚合方法如何保护或扭曲底层标注行为。在受控的合成实验和多个真实的人工标注基准数据集中,多数投票在标注员异质性和对抗性噪声下表现出得分误差和排名不稳定,而 STABLEVAL 能产生更稳定、在统计上具有依据的系统排名。这些结果表明,在可靠且可重复的 AI 评估中,建模 disagreement 至关重要。

关键词

引用

@article{arxiv.2605.02122,
  title  = {STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems},
  author = {Akash Bonagiri and Gerard Janno Anderias and Saee Patil and Angelina Lai and Devang Borkar and Gezheng Kang and Ishant Gandhi and Setareh Rafatirad and Houman Homayoun},
  journal= {arXiv preprint arXiv:2605.02122},
  year   = {2026}
}