中文

EntityCS:以实体为中心的代码切换改进零样本跨语言迁移

计算与语言 2023-02-14 v2

摘要

语言间的准确对齐对于改进跨语言预训练语言模型(XLMs)至关重要。受多语使用者中代码切换(CS)这一自然现象的启发,CS已被用作一种有效的数据增强方法,可在词或短语级别提供语言对齐,而非通过平行句对实现的句子级对齐。现有方法要么使用词典,要么使用带有词对齐的平行句来通过在句中随机切换词以生成CS数据。然而,这类方法可能并非最优,因为词典忽略语义,且随机词切换后句法可能失效。在本工作中,我们提出EntityCS,一种聚焦于实体级代码切换的方法,以在不破坏句法的前提下捕捉细粒度跨语言语义。我们利用Wikidata和英文维基百科,通过将实体切换为其他语言中的对应实体来构建以实体为中心的CS语料库。我们进一步在基于EntityCS语料库的中间模型训练中提出面向实体的掩码策略,以改进实体预测。在四个以实体为中心的下游任务上对训练模型的评估显示,相较基线有稳定提升,在事实检索(Fact Retrieval)上显著增长10%。我们发布该语料库与模型,以协助代码切换相关研究并利用外部知识丰富XLMs。

关键词

引用

@article{arxiv.2210.12540,
  title  = {EntityCS: Improving Zero-Shot Cross-lingual Transfer with Entity-Centric Code Switching},
  author = {Chenxi Whitehouse and Fenia Christopoulou and Ignacio Iacobacci},
  journal= {arXiv preprint arXiv:2210.12540},
  year   = {2023}
}

备注

Findings of EMNLP 2022