Camellia:面向亚洲语言的 LLM 文化偏见基准测试
计算与语言
2026-05-28 v2
摘要
随着大型语言模型(LLM)具备更强的多语言能力,其对文化多样性实体的敏感性日益重要。 Naous 等人(2024)的工作表明,LLM 常常偏向与西方关联实体的 Arabic。 由于缺乏以实体为中心的多语言基准测试,仍不清楚此类偏见是否也在各种非西方语言中显现。 本文我们引入 Camellia,用于评估九种亚洲语言中实体中心文化偏见的基准测试,涵盖六种亚洲文化。 Camellia 包括 19,530 个手动标注的实体,这些实体与所覆盖的亚洲或西方文化相关联,以及 2,173 个为这些实体派生的掩码上下文,这些上下文来自社交媒体帖子。 使用 Camellia,我们评估了四个最近的多语言 LLM 在三个任务中的文化偏见:文化情境适应、情感关联和实体抽取问答。 我们分析显示,LLM 在这些语言中处理文化适应方面存在困难,性能在不同区域开发的模型之间存在差异。 我们进一步观察到,不同的 LLM 系列可能持有不同的偏见,反映在它们将文化与特定情感关联的方式。 最后,我们发现 LLM 在处理某些亚洲语言的情境理解方面存在困难,这在实体抽取中导致不同文化之间存在性能差距。
引用
@article{arxiv.2510.05291,
title = {Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages},
author = {Tarek Naous and Anagha Savit and Carlos Rafael Catalan and Geyang Guo and Jaehyeok Lee and Kyungdon Lee and Lheane Marie Dizon and Mengyu Ye and Neel Kothari and Sahajpreet Singh and Sarah Masud and Tanish Patwa and Trung Thanh Tran and Zohaib Khan and Alan Ritter and Tanmoy Chakraborty and Yuki Arase and Keisuke Sakaguchi and JinYeong Bak and Wei Xu},
journal= {arXiv preprint arXiv:2510.05291},
year = {2026}
}