预训练多语言表示的语种中立性研究
计算与语言
2020-10-01 v4
摘要
多语言上下文嵌入,如多语言 BERT 与 XLM-RoBERTa,已被证明对许多多语言任务有用。先前工作通过形态与句法任务上的零样本迁移学习间接探查了表示的交叉语言性。我们则直接就词汇语义学考察多语言上下文嵌入的语种中立性。我们的结果表明,上下文嵌入比显式训练用于语种中立性的对齐静态词类型嵌入更具语种中立性,且一般而言信息更丰富。上下文嵌入默认仍仅为中等程度的语种中立,因此我们提出两种实现更强语种中立性的简单方法:其一,通过对每种语言的表示进行无监督中心化;其二,通过在小型平行数据上拟合显式投影。此外,我们展示了如何在不使用平行数据的情况下,在语言识别上达到最先进准确率,并匹配平行句词对齐的统计方法性能。
引用
@article{arxiv.2004.05160,
title = {On the Language Neutrality of Pre-trained Multilingual Representations},
author = {Jindřich Libovický and Rudolf Rosa and Alexander Fraser},
journal= {arXiv preprint arXiv:2004.05160},
year = {2020}
}
备注
12 pages, 3 figures. arXiv admin note: text overlap with arXiv:1911.03310. Accepted to Findings of EMNLP 2020