通过中文自然语言推理探究多语言预训练语言模型中的迁移学习
计算与语言
2021-06-09 v1 人工智能
摘要
多语言 transformer(XLM、mT5)已被证明在零样本设定下具有卓越的迁移能力。然而,多数迁移研究依赖自动翻译资源(XNLI、XQuAD),难以辨明所迁移的具体语言知识,以及开发特定任务模型时专家标注单语数据集的作用。我们研究 XLM-R 在中文与英文自然语言推理(NLI)上的跨语言迁移能力,重点关注近期大规模中文数据集 OCNLI。为更好理解语言迁移,我们基于若干知名英文资源(如 HANS、NLI stress-tests)为中文创建了 4 类挑战与对抗任务(共 17 个新数据集)。我们发现,在英语 NLI 上训练的跨语言模型在我们的中文任务上迁移良好(例如,在 3/4 的挑战类别中,其表现与最佳单语模型相当或更优,即便在 3/5 的独特中文语言现象如成语、代词脱落上也是如此)。但这些结果伴随重要 caveat:跨语言模型在由英语与高质量单语 NLI 数据(OCNLI)混合训练时往往表现最佳,且常受自动翻译资源(XNLI-zh)阻碍。对许多现象,所有模型仍表现不佳,凸显了我们的新诊断基准对评测中文与跨语言模型的必要性。所有新数据集/代码发布于 https://github.com/huhailinguist/ChineseNLIProbing。
引用
@article{arxiv.2106.03983,
title = {Investigating Transfer Learning in Multilingual Pre-trained Language Models through Chinese Natural Language Inference},
author = {Hai Hu and He Zhou and Zuoyu Tian and Yiwen Zhang and Yina Ma and Yanting Li and Yixin Nie and Kyle Richardson},
journal= {arXiv preprint arXiv:2106.03983},
year = {2021}
}
备注
accepted to ACL Findings 2021