中文

大语言模型在长文本中仍表现出偏见

计算与语言 2025-08-08 v3

摘要

现有的大语言模型公平性基准主要关注简单任务,例如多项选择题,忽略了在更复杂场景(如长文本生成)中可能出现的偏见。为弥补这一空白,我们引入了长文本公平性测试(LTF-TEST),这是一个通过论文式提示评估LLM偏见的框架。LTF-TEST涵盖14个主题和10个人口统计轴(包括性别和种族),共包含11,948个样本。通过评估模型响应及其背后的推理,LTF-TEST揭示了在简单响应中难以察觉的微妙偏见。在我们对包括GPT-4o和LLaMa3在内的五个最新LLM的评估中,我们识别出两种关键的偏见模式。首先,这些模型在响应中经常偏向某些人口统计群体。其次,它们对传统上处于弱势的群体表现出过度敏感,常常提供过度保护的响应而忽视其他群体。为减轻这些偏见,我们提出了FT-REGARD,一种将带有偏见的提示与中性响应配对的微调方法。FT-REGARD在BBQ基准上将性别偏见降低了34.6%,并将性能提升了1.4个百分点,为处理长文本生成任务中的偏见提供了一种有前景的方法。

关键词

引用

@article{arxiv.2410.17519,
  title  = {Large Language Models Still Exhibit Bias in Long Text},
  author = {Wonje Jeung and Dongjae Jeon and Ashkan Yousefpour and Jonghyun Choi},
  journal= {arXiv preprint arXiv:2410.17519},
  year   = {2025}
}

备注

Accepted by ACL, code and models are available at https://github.com/WonjeJeung/LTF-TEST