中文

人类还是LLM?评估判决偏差的研究

计算与语言 2024-09-27 v5

摘要

将人类和大型语言模型(LLM)作为判官(即人类和LLM-as-a-judge)来评估LLM性能最近受到关注。然而,这种方法同时引入了来自人类和LLM的潜在偏见,质疑了评估结果的可靠性。本文提出了一种无需引用 groundtruth 标注的框架,用于探讨误信息疏忽偏差、性别偏差、权威偏差和美貌偏差对LLM和人类判官的影响。我们参考修订版的布鲁姆分类法构建数据集,并进行了数千次评估。结果表明,人类和LLM判官都对各种扰动都表现出不同程度的脆弱性,即使是最先进的判官也具有相当大的偏见。我们进一步利用这些偏见对LLM判官进行攻击。我们希望我们的工作能提醒社区注意人类和LLM-as-a-judge的偏见和脆弱性,以及开发稳健评估系统的紧迫性。

关键词

引用

@article{arxiv.2402.10669,
  title  = {Humans or LLMs as the Judge? A Study on Judgement Biases},
  author = {Guiming Hardy Chen and Shunian Chen and Ziche Liu and Feng Jiang and Benyou Wang},
  journal= {arXiv preprint arXiv:2402.10669},
  year   = {2024}
}

备注

EMNLP2024