多语言LAMA:探究多语言预训练语言模型中的知识
计算与语言
2021-02-02 v1
摘要
近来研究发现,单语英语语言模型可用作知识库。与结构化知识库查询不同,此类研究使用如“巴黎是[MASK]的首都”这样的掩码句子作为探针。我们将成熟的基准TREx和GoogleRE翻译为53种语言。基于mBERT,我们探究三个问题。(i) mBERT能否用作多语言知识库?先前多数工作仅考虑英语。将研究扩展至多种语言对多样性和可及性十分重要。(ii) mBERT作为知识库的表现是否与语言无关,还是因语言而异?(iii) 多语言模型在更多文本上训练,例如mBERT在104种维基百科上训练。mBERT能否借此获得更好表现?我们发现,将mBERT用作知识库在不同语言上表现不一,而跨语言汇聚预测可提升表现。反之,mBERT表现出语言偏置;例如,用意大利语查询时,它倾向于预测意大利为原属国家。
引用
@article{arxiv.2102.00894,
title = {Multilingual LAMA: Investigating Knowledge in Multilingual Pretrained Language Models},
author = {Nora Kassner and Philipp Dufter and Hinrich Schütze},
journal= {arXiv preprint arXiv:2102.00894},
year = {2021}
}
备注
Accepted to EACL 2021