中文

错误之色:仅针对错误答案的 LLM 对齐

计算与语言 2024-10-16 v1 人工智能

摘要

在缺乏大量可靠标注用于挑战任务和情境的情况下,我们如何能够通过可能的错误答案来扩展 LLM 的能力边界?我们聚焦于两个研究问题:(1)LLM 是否能够在错误选项之间生成可靠的偏好?如果是的话,(2)与此类错误-错误偏好进行对齐是否有益?我们采用基于自洽性、标记概率和 LLM 作为评判器的方法,从而从访谈中提取错误-错误偏好,并使用这些综合的偏好进行偏好优化方法的语言模型微调。针对七个 LLM 和八个数据集进行大规模实验,证明:(1)LLM 在区分各种错误程度方面具有初步能力,性能比随机猜测高出 20.9%;(2)与错误-错误偏好进行对齐有助于 LLM 产生更少的错误,有时甚至产生正确的答案,同时整体上改善了模型的校准。

关键词

引用

@article{arxiv.2410.11055,
  title  = {Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only},
  author = {Jihan Yao and Wenxuan Ding and Shangbin Feng and Lucy Lu Wang and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2410.11055},
  year   = {2024}
}