中文

通过作者身份混淆缓解自我偏好

计算与语言 2025-12-08 v1 人工智能

摘要

语言模型(LM)评判器被广泛用于评估语言模型输出的质量。尽管具有许多优势,LM评判器表现出令人担忧的偏差,可能损害其评估的完整性。其中一种偏差是自我偏好:LM评判器偏好自己的答案,而非其他语言模型或人类生成的答案。由于前沿LM评判器能够区分自己的输出与他人的输出,即使评估候选未标注来源,这种偏差也难以消除。在本文中,我们研究了通过降低LM评判器识别自身输出的能力来缓解自我偏差的策略。我们在成对比较中对评估候选应用黑盒扰动,以混淆作者身份并减少自我识别。我们发现,像对少数词语进行同义词替换这样简单的扰动,可预测地减少自我偏好。然而,我们也发现了消除该偏差的根本挑战:当我们将扰动外推以更完整地消除评估候选之间的风格差异时,自我偏好会恢复。我们的发现表明,自我识别和自我偏好可以在许多语义层面发生,尽管初步结果令人鼓舞,但完全缓解仍然具有挑战性。

关键词

引用

@article{arxiv.2512.05379,
  title  = {Mitigating Self-Preference by Authorship Obfuscation},
  author = {Taslim Mahbub and Shi Feng},
  journal= {arXiv preprint arXiv:2512.05379},
  year   = {2025}
}