正义还是偏见?量化 LLM 评判器中的偏见
计算与语言
2024-10-07 v2 人工智能
摘要
LLM 评判器 (LLM-as-a-Judge) 已被广泛用于各种基准测试中,并作为模型训练中的监督奖励。然而,尽管在许多领域表现出色,但其潜在问题仍未得到充分探讨,这削弱了其可靠性和实用范围。因此,我们识别出 12 项关键潜在偏见,并提出了新的自动化偏见量化框架-CALM,通过使用自动化和原则导向的修改系统地量化和分析 LLM 评判器中每种偏见类型。我们的实验覆盖多个流行语言模型,结果表明尽管高级模型在整体性能方面取得了令人钦佩的成绩,但在特定任务中仍存在显著偏见。经验结果表明,LLM 评判器的可靠性仍有提升空间。此外,我们还讨论了这些偏见的明确和隐式影响,并给出了可靠应用 LLM 评判器的建议。我们的工作凸显了利益相关者需要解决这些问题的必要性,并提醒用户在 LLM 评判器应用中需谨慎使用。
引用
@article{arxiv.2410.02736,
title = {Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge},
author = {Jiayi Ye and Yanbo Wang and Yue Huang and Dongping Chen and Qihui Zhang and Nuno Moniz and Tian Gao and Werner Geyer and Chao Huang and Pin-Yu Chen and Nitesh V Chawla and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2410.02736},
year = {2024}
}