风格压倒实质:LLM评判器在对齐基准测试中的失效模式
机器学习
2025-01-28 v3 人工智能
摘要
2022年11月ChatGPT的发布引发了对后训练方法的浓厚兴趣,以及大量新的偏好优化(PO)方法的涌现。这些方法声称通过更好地与人类两两偏好相吻合(通常由LLM评判器衡量)来实现更好的对齐。本文旨在回答以下问题——LLM评判器的偏好是否与更具体的对齐度量标准相关,如果不相关,原因何在?我们定义了对齐的具体度量标准,并引入SOS-Bench(Substance Outweighs Style Benchmark),据称是迄今为止最大的标准化、可复现的LLM元基准测试。我们发现:(1)LLM评判器的偏好与安全、世界知识和指令遵循的具体措施不相关;(2)LLM评判器具有强大的隐式偏见,优先考虑风格而非事实性和安全性;(3)后训练的监督微调(SFT)阶段(而非PO阶段)对对齐影响最大,数据规模和提示词多样性是驱动因素。我们的代码库和完整结果可在https://github.com/penfever/sos-bench查阅。
引用
@article{arxiv.2409.15268,
title = {Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking},
author = {Benjamin Feuer and Micah Goldblum and Teresa Datta and Sanjana Nambiar and Raz Besaleli and Samuel Dooley and Max Cembalest and John P. Dickerson},
journal= {arXiv preprint arXiv:2409.15268},
year = {2025}
}
备注
ICLR 2025