中文

BertaQA:语言模型对当地文化了解多少?

计算与语言 2024-11-19 v2 人工智能 机器学习

摘要

大语言模型(LLMs)在世界知识方面表现出广泛的了解,但大多数评估仅限于全球或以英语为中心的主题。这引出了一个问题:这些模型在其他文化相关的话题上表现如何,尽管这些话题在网络上的存在并不突出。为解决这一差距,我们引入 BertaQA,这是一个并行于英语和巴斯克语的多选恶作剧数据集。该数据集包含与巴斯克文化相关的本地子集以及涵盖更广泛兴趣的全球子集问题。我们发现,最先进的 LLMs 在本地文化知识方面仍存在困难,尽管在全球话题上表现出色。然而,我们表明在巴斯克语进行持续预训练显著提高了模型在巴斯克文化方面的表现,即使以英语查询亦然。据我们了解,这是首次获得关于语言与知识之间复杂相互作用的坚实证据,并表明在重新评估本地话题时,一些先前发现并不完全成立。我们的数据集和评估代码均在开放许可下提供,地址为 https://github.com/juletx/BertaQA。

关键词

引用

@article{arxiv.2406.07302,
  title  = {BertaQA: How Much Do Language Models Know About Local Culture?},
  author = {Julen Etxaniz and Gorka Azkune and Aitor Soroa and Oier Lopez de Lacalle and Mikel Artetxe},
  journal= {arXiv preprint arXiv:2406.07302},
  year   = {2024}
}

备注

NEURIPS Datasets & Benchmarks 2024