中文

RIFT:评分量规失效模式分类法与自动化诊断

人工智能 2026-04-22 v2

摘要

基于评分量规的评估广泛用于 LLM 基准测试和开放式、难以验证任务的训练流程。尽管先前工作已证明利用强化学习结果等下游信号来使用评分量规的有效性,但目前仍缺乏从这些聚合或下游信号出发,系统诊断评分量规本身如何失效的原则性方法。为填补这一空白,我们提出了 RIFT(RubrIc Failure mode Taxonomy):一种系统刻画评分量规组成与设计中失效模式的分类法。RIFT 由八个失效模式组成,归纳为三个高层类别:可靠性失效、内容有效性失效和后果有效性失效。RIFT 通过扎根理论方法开发,通过对来自五个不同数据源(涵盖通用指令遵循、代码生成、创意写作和专家级深度研究)的评分量规进行迭代标注,直至不再发现新的失效模式。我们通过测量独立人工标注者之间的一致性来评估该分类法的稳定性,整体上观察到一致性较高(87% 的成对一致性和 0.64 的平均 Cohen's kappa)。最后,为支持可扩展诊断,我们提出了自动化评分量规质量指标,并证明其与人工失效模式标注一致,最高达到 0.925 的 F1 值。

关键词

引用

@article{arxiv.2604.01375,
  title  = {RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics},
  author = {Zhengyang Qi and Charles Dickens and Derek Pham and Amanda Dsouza and Armin Parchami and Frederic Sala and Paroma Varma},
  journal= {arXiv preprint arXiv:2604.01375},
  year   = {2026}
}