中文

傲慢与偏见:大语言模型在自我改进中放大自我偏见

计算与语言 2024-06-19 v2 人工智能

摘要

最近的研究表明,大语言模型通过自我反馈在某些任务上提高了性能,而在其他任务上则有所下降。我们发现这种反差是由于大语言模型在评估自身输出时存在偏见。在本文中,我们使用两个统计量正式定义了大语言模型的自我偏见——倾向于偏爱自身生成的倾向。我们分析了六个大语言模型(GPT-4、GPT-3.5、Gemini、LLaMA2、Mixtral和DeepSeek)在翻译、受限文本生成和数学推理任务上的表现。我们发现自我偏见在所有被检查的大语言模型中普遍存在,跨越多种语言和任务。我们的分析表明,虽然自我改进流程提高了模型输出的流畅性和可理解性,但它进一步放大了自我偏见。为了缓解这种偏见,我们发现更大的模型规模和带有准确评估的外部反馈可以显著减少自我改进流程中的偏见,从而在下游任务中带来实际的性能提升。代码和数据发布在https://github.com/xu1998hz/llm_self_bias。

关键词

引用

@article{arxiv.2402.11436,
  title  = {Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement},
  author = {Wenda Xu and Guanglei Zhu and Xuandong Zhao and Liangming Pan and Lei Li and William Yang Wang},
  journal= {arXiv preprint arXiv:2402.11436},
  year   = {2024}
}