跨语言的子词映射与锚定
计算与语言
2021-09-13 v1
摘要
最先进的多语言系统依赖于能够充分覆盖所有目标语言的共享词表。为此,一种简单且常用的方法是利用在多种语言上联合构建的子词词表。我们假设此类词表是次优的,原因在于存在假阳性(跨语言中含义不同但形式相同的子词)和假阴性(跨语言中含义相似但形式不同的子词)。为了解决这些问题,我们提出了跨语言子词映射与锚定(SMALA),一种构建双语子词词表的方法。SMALA利用无监督的最先进映射技术提取子词对齐,并基于子词相似性利用它们创建跨语言锚点。我们展示了SMALA在跨语言自然语言推理(XNLI)中的优势,它通过仅共享子词嵌入,即可改善对无任务特定数据的未见语言的零样本迁移。此外,在神经机器翻译中,我们表明由SMALA获得的联合子词词表在包含大量假阳性和假阴性的句子上能取得更高的BLEU分数。
引用
@article{arxiv.2109.04556,
title = {Subword Mapping and Anchoring across Languages},
author = {Giorgos Vernikos and Andrei Popescu-Belis},
journal= {arXiv preprint arXiv:2109.04556},
year = {2021}
}
备注
EMNLP 2021, Findings of EMNLP2021