多语言大语言模型跨越语言边界泄露人类刻板印象
计算与语言
2024-11-20 v3
摘要
多语言大语言模型因其在跨语言处理和生成文本方面的熟练程度而备受关注。与其单语对应模型一样,多语言模型很可能会捕捉到其训练数据中存在的刻板印象和其他社会偏见。在本文中,我们研究了一种我们称之为“刻板印象泄露”的现象,指的是多语言训练模型可能会导致在一种语言中表达的刻板印象出现在该模型在另一种语言中的行为里。我们提出了一个用于衡量刻板印象泄露的框架,并调查了其在英语、俄语、中文和印地语以及 GPT-3.5、mT5 和 mBERT 上的影响。我们的研究结果表明,在所有语言中都存在明显的积极、消极和非极性关联的泄露。我们发现,在这些模型中,GPT-3.5 表现出最多的刻板印象泄露,而印地语最容易受到泄露效应的影响。警告:本文包含可能具有冒犯性的模型输出。
引用
@article{arxiv.2312.07141,
title = {Multilingual large language models leak human stereotypes across language boundaries},
author = {Yang Trista Cao and Anna Sotnikova and Jieyu Zhao and Linda X. Zou and Rachel Rudinger and Hal Daume},
journal= {arXiv preprint arXiv:2312.07141},
year = {2024}
}