中文

CaLMQA: 跨23种语言的特定文化长文本问答探索

计算与语言 2025-06-12 v3 人工智能 机器学习

摘要

尽管大型语言模型(LLM)的全球使用日益增长,但它们生成针对特定文化问题的长文本答案的能力在许多语言中仍未得到探索。为填补这一空白,我们通过创建CaLMQA(一个包含23种不同语言、51.7万个特定文化问题的数据集)进行了首次文本多语言长文本问答研究。我们将特定文化问题定义为那些指代一种或几种文化特有概念,或根据文化或地区背景有不同答案的问题。我们通过从高资源语言的社区网络论坛爬取自然出现的问题,以及雇佣母语者用低资源、鲜少研究的语言(如斐济语和基隆迪语)编写问题来获取这些问题。我们的数据收集方法无需翻译,从而能够收集诸如“Kuber iki umwami wa mbere w'uburundi yitwa Ntare?”(基隆迪语;英文翻译:“Why was the first king of Burundi called Ntare (Lion)?”)这样的文化独特问题。我们评估了LLM生成的长文本答案的事实性、相关性和表面质量,发现:(1)对于许多语言,即使是最好的模型也会犯严重的表面错误(例如,用错误语言回答、重复),尤其是在低资源语言中;(2)对特定文化问题的答案比对文化无关问题(即在多种文化中含义和答案一致的问题)的答案包含更多事实错误。我们发布CaLMQA以促进未来在文化和多语言长文本问答方面的研究。

关键词

引用

@article{arxiv.2406.17761,
  title  = {CaLMQA: Exploring culturally specific long-form question answering across 23 languages},
  author = {Shane Arora and Marzena Karpinska and Hung-Ting Chen and Ipsita Bhattacharjee and Mohit Iyyer and Eunsol Choi},
  journal= {arXiv preprint arXiv:2406.17761},
  year   = {2025}
}

备注

46 pages, 26 figures. Accepted as a main conference paper at ACL 2025. Code and data available at https://github.com/2015aroras/CaLMQA . Dataset expanded to 51.7K questions