MAKIEval:面向 LLM 文化意识评估的多语言自动 Wikidata 框架
计算与语言
2025-09-23 v3
摘要
大语言模型(LLM)在全球范围内被广泛应用于多种语言,但其以英语为中心的预训练引发了人们对跨语言文化意识差异的担忧,这往往导致有偏见的输出。然而,由于基准测试有限且翻译质量存疑,全面的多语言评估仍具挑战性。为了更好地评估这些差异,我们引入了 MAKIEval,一个用于跨语言、地区和主题评估 LLM 文化意识的自动多语言框架。MAKIEval 评估开放式文本生成,捕捉模型如何以自然语言表达植根于文化的知识。它利用 Wikidata 的多语言结构作为跨语言锚点,自动识别模型输出中的文化实体并将其链接到结构化知识,从而实现可扩展的、与语言无关的评估,而无需人工标注或翻译。随后,我们引入了四个指标,捕捉文化意识的互补维度:粒度、多样性、文化特异性和跨语言共识。我们评估了来自世界不同地区开发的 7 个 LLM,涵盖开源和专有系统,跨越 13 种语言、19 个国家和地区以及 6 个具有文化显著性的主题(例如,食物、服装)。值得注意的是,我们发现模型往往在英语中表现出更强的文化意识,这表明英语提示能更有效地激活植根于文化的知识。
引用
@article{arxiv.2505.21693,
title = {MAKIEval: A Multilingual Automatic WiKidata-based Framework for Cultural Awareness Evaluation for LLMs},
author = {Raoyuan Zhao and Beiduo Chen and Barbara Plank and Michael A. Hedderich},
journal= {arXiv preprint arXiv:2505.21693},
year = {2025}
}
备注
Accepted by EMNLP 2025 Findings, 33 pages, 30 figures