中文

GeoMLAMA:多语言预训练语言模型上的地理多样性常识探测

计算与语言 2022-11-30 v2

摘要

近期研究表明,预训练语言模型(PLMs)存储了从数据中学习到的关系知识,并利用其执行下游任务。然而,不同地区的常识知识可能有所不同。例如,在美国婚礼中新娘礼服的颜色是白色,而在中国婚礼中则是红色。本文引入了一个基准数据集,即地理多样性常识多语言语言模型分析(GeoMLAMA),用于探测多语言PLM中关系知识的多样性。GeoMLAMA包含英语、汉语、印地语、波斯语和斯瓦希里语中的3,125个提示,广泛覆盖了美国、中国、印度、伊朗和肯尼亚文化背景下人们共享的概念。我们在GeoMLAMA上对11个标准多语言PLM进行了基准测试。有趣的是,我们发现:1)较大的多语言PLM变体未必比较小的变体更好地存储地理多样性概念;2)多语言PLM并非本质上偏向于来自西方国家(美国)的知识;3)一个国家的母语可能并非探测其知识的最佳语言;4)某种语言可能比其母语国家更好地探测关于非母语国家的知识。代码和数据发布于 https://github.com/WadeYin9712/GeoMLAMA。

关键词

引用

@article{arxiv.2205.12247,
  title  = {GeoMLAMA: Geo-Diverse Commonsense Probing on Multilingual Pre-Trained Language Models},
  author = {Da Yin and Hritik Bansal and Masoud Monajatipoor and Liunian Harold Li and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2205.12247},
  year   = {2022}
}

备注

EMNLP 2022. Code and data are released at https://github.com/WadeYin9712/GeoMLAMA/