中文

弥合语言模型与跨语言序列标注之间的鸿沟

计算与语言 2022-04-12 v1 人工智能

摘要

大规模跨语言预训练语言模型(xPLMs)已在跨语言序列标注任务(xSL)中展现出有效性,例如通过从高资源语言向低资源语言迁移知识来实现跨语言机器阅读理解(xMRC)。尽管取得巨大成功,我们经实证观察发现预训练与微调阶段间存在训练目标鸿沟:例如,掩码语言建模目标要求对掩码词元的局部理解,而跨度抽取目标要求对输入篇章/段落与问题的全局理解与推理,导致预训练与 xMRC 之间的偏差。本文中,我们首先设计了一个专为 xSL 定制的预训练任务,称为跨语言语言信息性跨度掩码(CLISM),以自监督方式消除目标鸿沟。其次,我们提出对比-一致性正则化(CACR),其利用对比学习,在预训练期间通过无监督跨语言实例级训练信号,鼓励输入平行序列表征之间的一致性。通过这些手段,我们的方法不仅弥合了预训练-微调之间的鸿沟,还增强了 PLM 以更好地捕捉不同语言间的对齐。大量实验证明,在有限预训练数据下,我们的方法在多个 xSL 基准上取得了明显更优的结果。在少样本数据设置(仅数百训练样例可用)中,我们的方法也大幅超越先前的 SOTA 方法。

关键词

引用

@article{arxiv.2204.05210,
  title  = {Bridging the Gap between Language Models and Cross-Lingual Sequence Labeling},
  author = {Nuo Chen and Linjun Shou and Ming Gong and Jian Pei and Daxin Jiang},
  journal= {arXiv preprint arXiv:2204.05210},
  year   = {2022}
}

备注

15 pages