中文

缺失什么:大型语言模型输出的可解释评分

计算与语言 2026-03-06 v1 人工智能

摘要

当前大型语言模型(LLM)偏好学习方法,如近端策略优化(PPO)和直接偏好优化(DPO),依赖模型输出的直接排序或数值评分,但这些排序具有主观性,单个由裁判员直接选择的数值评分是对自然语言质量的糟糕代理。我们引入 What Is Missing(WIM)评分系统,通过自然语言反馈生成排名,WIM 可集成到现有训练管道中,可与其他评分技术组合,作为偏好学习方法的输入,无需改变学习算法。要计算 WIM 评分,人类或 LLM 裁判员撰写描述模型输出缺失内容的反馈,我们使用句子嵌入模型对输出和反馈进行嵌入,并计算 resulting vectors 之间的余弦相似度。我们经验性地观察到,与离散数值评分相比,WIM 产生更少的平局并产生更大的评分差值,这提高了两两偏好数据中学习信号的可用性。我们在以下有限意义上使用可解释性:对于每个标量评分,我们可以检查产生它的裁判员缺失信息文本,从而实现对偏好标签的定性调试。

关键词

引用

@article{arxiv.2603.04429,
  title  = {What Is Missing: Interpretable Ratings for Large Language Model Outputs},
  author = {Nicholas Stranges and Yimin Yang},
  journal= {arXiv preprint arXiv:2603.04429},
  year   = {2026}
}

备注

22 pages