PerCul:面向波斯语的基于故事的文化评估基准
计算与语言
2025-07-21 v1 人工智能
计算机与社会
摘要
大型语言模型主要反映西方文化,主要由于以英语为中心的训练数据占据主导地位。这种不平衡在LLM跨越多样化语境且缺乏对非英语语言(包括波斯语)文化能力的充分评估方面 presents a significant challenge。为填补这一差距,我们引入PerCul,一个精心构建的数据集,用于评估LLM对波斯语文化的敏感性。PerCul包含基于故事的多选问题,捕捉文化细微差别情景。与现有基准不同,PerCul由波斯语母语标注员参与策划,以确保其真实性并防止翻译作为捷径。我们评估了多个最先进的多语言和波斯语专用LLM,为未来的跨文化NLP评估奠定了基础。我们的实验显示,使用最佳闭源模型时,与普通人基准之间的差距为11.3%,而使用最佳开源模型时,差距增加至21.3%。你可以在此处访问数据集:https://huggingface.co/datasets/teias-ai/percul
引用
@article{arxiv.2502.07459,
title = {PerCul: A Story-Driven Cultural Evaluation of LLMs in Persian},
author = {Erfan Moosavi Monazzah and Vahid Rahimzadeh and Yadollah Yaghoobzadeh and Azadeh Shakery and Mohammad Taher Pilehvar},
journal= {arXiv preprint arXiv:2502.07459},
year = {2025}
}
备注
Accepted at NAACL 2025 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/percul)