偏好泄露:LLM-as-a-judge中的一种污染问题
机器学习
2026-03-05 v3 人工智能
计算与语言
摘要
大型语言模型(LLM)作为评判者和基于LLM的数据合成已成为模型开发中两种基本的LLM驱动的数据标注方法。虽然它们的结合显著提高了模型训练和评估的效率,但很少有人关注这种新的模型开发范式带来的潜在污染。在这项工作中,我们揭示了偏好泄露,这是LLM-as-a-judge中由于合成数据生成器与基于LLM的评估器之间的关联性而导致的一种污染问题。为了研究这个问题,我们首先定义了数据生成器LLM和评判器LLM之间的三种常见关联性:是同一模型、具有继承关系、以及属于同一模型家族。通过大量实验,我们在多个LLM基线和基准测试中实证确认了由于偏好泄露导致的评判器对其相关学生模型的偏见。进一步分析表明,与LLM-as-a-judge场景中先前识别的偏见相比,偏好泄露是一个更难以检测的普遍且现实的问题。所有这些发现都意味着偏好泄露是LLM-as-a-judge领域一个广泛且具有挑战性的问题。我们在以下地址发布了所有代码和数据:https://github.com/David-Li0406/Preference-Leakage。
引用
@article{arxiv.2502.01534,
title = {Preference Leakage: A Contamination Problem in LLM-as-a-judge},
author = {Dawei Li and Renliang Sun and Yue Huang and Ming Zhong and Bohan Jiang and Jiawei Han and Xiangliang Zhang and Wei Wang and Huan Liu},
journal= {arXiv preprint arXiv:2502.01534},
year = {2026}
}
备注
Accepted by ICLR 2026