CharSpan:利用词法相似性实现极低位资源语言的零样本机器翻译
计算与语言
2024-02-06 v2
摘要
我们通过利用来自“紧密相关的”高位资源语言(HRL)的跨语言迁移,解决从极低位资源语言(ELRL)到英语的机器翻译(MT)任务。为ELRL开发MT系统具有挑战性,因为这些语言通常缺乏平行语料库和单语语料库,且其表示不存在于大型多语言语言模型中。许多ELRL与某些HRL共享词法相似性,这提供了一个新颖的建模机会。然而,现有的基于子词的神经MT模型并未显式利用此词法相似性,因为它们仅隐式对齐HRL和ELRL的潜在嵌入空间。为克服此限制,我们提出一种新颖的CharSpan方法,基于向HRL训练数据中注入“字符跨度噪声增强”。这作为一种正则化技术,使模型对HRL与ELRL之间的“词法差异”更鲁棒,从而促进有效的跨语言迁移。我们的方法在来自三个不同语系的紧密相关HRL与ELRL对的零样本设定下显著优于强基线,成为ELRL的state-of-the-art模型。
引用
@article{arxiv.2305.05214,
title = {CharSpan: Utilizing Lexical Similarity to Enable Zero-Shot Machine Translation for Extremely Low-resource Languages},
author = {Kaushal Kumar Maurya and Rahul Kejriwal and Maunendra Sankar Desarkar and Anoop Kunchukuttan},
journal= {arXiv preprint arXiv:2305.05214},
year = {2024}
}