中文

祈祷后喝啤酒?衡量大语言模型中的文化偏见

计算与语言 2024-03-21 v4 人工智能 机器学习

摘要

随着大语言模型(LMs)的全球影响力不断扩大,其适应多元文化语境的能力变得至关重要。尽管多语言能力有所进展,模型并未针对恰当的文化细微差异进行设计。在本文中,我们表明多语言及阿拉伯语单语 LMs 对与西方文化相关的实体表现出偏见。我们提出 CAMeL,一个包含 628 条自然出现的提示及横跨八类、共 20,368 个对比阿拉伯与西方文化的实体的新型资源。CAMeL 通过外在和内在评估为衡量 LMs 中的文化偏见提供了基础。利用 CAMeL,我们考察了 16 个不同 LMs 在阿拉伯语下的跨文化表现,任务包括故事生成、NER 和情感分析,其中发现了令人担忧的刻板印象与文化不公平案例。我们进一步测试了它们的文本填充表现,揭示出其对阿拉伯文化语境缺乏恰当适应能力。最后,我们分析了 6 个阿拉伯语预训练语料库,发现若不经调整直接使用,维基百科等常用来源可能并不最适合构建具有文化意识的 LMs。我们将在 https://github.com/tareknaous/camel 公开 CAMeL。

关键词

引用

@article{arxiv.2305.14456,
  title  = {Having Beer after Prayer? Measuring Cultural Bias in Large Language Models},
  author = {Tarek Naous and Michael J. Ryan and Alan Ritter and Wei Xu},
  journal= {arXiv preprint arXiv:2305.14456},
  year   = {2024}
}