中文

面向鲁棒语码混合翻译的合成数据生成与联合学习

计算与语言 2024-05-01 v2 机器学习

摘要

现代多语言世界中广泛的在线通信提供了在单个话语中混合多种语言(即语码混合语言)的机会。由于标注数据的稀缺和噪声的存在,这给计算模型带来了巨大的挑战。在低资源设置中缓解数据稀缺问题的一个潜在解决方案是通过翻译利用资源丰富语言中的现有数据。在本文中,我们解决了语码混合(Hinglish 和 Bengalish)到英语的机器翻译问题。首先,我们合成了 HINMIX,一个包含约 420 万句对的 Hinglish 到英语的平行语料库。随后,我们提出了 RCMT,一个基于鲁棒扰动的联合训练模型,通过在干净词和噪声词之间共享参数来学习处理真实世界语码混合文本中的噪声。此外,我们展示了 RCMT 在 Bengalish 到英语翻译的零样本设置中的适应性。我们的评估和综合分析在定性和定量上证明了 RCMT 优于最先进的语码混合和鲁棒翻译方法。

关键词

引用

@article{arxiv.2403.16771,
  title  = {Synthetic Data Generation and Joint Learning for Robust Code-Mixed Translation},
  author = {Kartik Kartik and Sanjana Soni and Anoop Kunchukuttan and Tanmoy Chakraborty and Md Shad Akhtar},
  journal= {arXiv preprint arXiv:2403.16771},
  year   = {2024}
}

备注

9 pages, 2 figures, to be published in LREC-COLING 2024