LLM-as-a-Judge 中教师偏好偏差的助手引导缓解
计算与语言
2025-09-19 v3
摘要
LLM-as-a-Judge 采用大语言模型(LLMs),如 GPT-4,来评估 LLM 生成的回复质量,因其成本效益高且与人类评估高度一致而日益普及。然而,使用由强大教师模型生成的评估数据来训练代理评判模型引入了一个关键但此前被忽视的问题:教师偏好偏差,即代理评判模型对教师模型的回复学习到了有偏见的偏好。为了解决这个问题,我们提出了一种新设置,引入一个不偏向教师模型回复的额外助手模型来补充训练数据。基于此设置,我们引入了 AGDe-Judge,这是一个旨在从训练数据中的标签和反馈两方面进行去偏的三阶段框架。大量实验表明,AGDe-Judge 有效减少了教师偏好偏差,同时在六个评估基准上保持了强劲的性能。代码可在 https://github.com/Liuz233/AGDe-Judge 获取。
关键词
引用
@article{arxiv.2505.19176,
title = {Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge},
author = {Zhuo Liu and Moxin Li and Xun Deng and Qifan Wang and Fuli Feng},
journal= {arXiv preprint arXiv:2505.19176},
year = {2025}
}
备注
Under review