中文

MBBQ:用于跨语言比较生成式大语言模型偏见的数据集

计算与语言 2024-07-18 v3

摘要

生成式大语言模型(LLMs)已被证明会表现出有害偏见和刻板印象。尽管安全微调通常在英语中进行(如果有的话),但这些模型正在被来自不同语言的使用者所使用。已有证据表明,这些模型在不同语言上的表现不一致,并且会基于用户的人口统计特征进行歧视。为此,我们调查生成式大语言模型是否因所使用的语言而呈现不同的社会刻板印象,同时控制文化差异和任务准确性。为此,我们提出了 MBBQ(Multilingual Bias Benchmark for Question-answering),即对英文 BBQ 数据集进行精心挑选并扩展至荷兰语、西班牙语和土耳其语的数据集,衡量这些语言中普遍持有的刻板印象。我们进一步补充 MBBQ,提供一个平行控制数据集,以独立于偏见地衡量问答任务的性能。基于多个开源和专有 LLMs 的结果确认,即使控制文化迁移,某些非英语语言的偏见程度高于英语。此外,我们观察到除最准确模型之外的所有模型在偏见行为方面都存在显著的跨语言差异。随着 MBBQ 的发布,我们希望能够鼓励更多关于多语言环境下偏见的研究。数据集和代码已提供于 https://github.com/Veranep/MBBQ。

关键词

引用

@article{arxiv.2406.07243,
  title  = {MBBQ: A Dataset for Cross-Lingual Comparison of Stereotypes in Generative LLMs},
  author = {Vera Neplenbroek and Arianna Bisazza and Raquel Fernández},
  journal= {arXiv preprint arXiv:2406.07243},
  year   = {2024}
}

备注

Accepted to COLM 2024