X-FACTR:从预训练语言模型中进行多语言事实知识检索
计算与语言
2020-10-28 v3
摘要
语言模型(LMs)已被证明在通过完成填空式问题(如“Punta Cana 位于_。”)捕获事实知识方面出奇地成功。然而,尽管知识以多种语言书写和查询,关于 LMs 事实表征能力的研究几乎无一例外地在英语上进行。为评估不同语言下 LMs 中的事实知识检索,我们创建了一个涵盖 23 种类型学多样语言的多语言填空式探针基准。为妥善处理语言差异,我们将探针方法从单词实体扩展至多词实体,并开发了若干解码算法以生成多词元预测。广泛的实验结果揭示了当前最先进 LMs 在资源较多或较少语言上执行该任务的表现优劣。我们进一步提出一种基于语码转换的方法来提升多语言 LMs 的知识访问能力,并在若干基准语言上验证了其有效性。基准数据与代码已发布于 https://x-factr.github.io。
引用
@article{arxiv.2010.06189,
title = {X-FACTR: Multilingual Factual Knowledge Retrieval from Pretrained Language Models},
author = {Zhengbao Jiang and Antonios Anastasopoulos and Jun Araki and Haibo Ding and Graham Neubig},
journal= {arXiv preprint arXiv:2010.06189},
year = {2020}
}
备注
EMNLP 2020