中文

探索语言相似性与零样本学习用于达罗毗荼语言的多语翻译

计算与语言 2023-08-11 v1 计算机视觉与模式识别

摘要

当前零样本翻译研究受若干问题困扰,如高计算需求、训练时间增加及离题翻译。所提补救办法常以额外数据或计算需求为代价。尽管训练与评估时间增加,基于枢纽的神经网络机器翻译在大多数设定下仍优于单编码器模型。本工作中,我们利用音译与语言相似性克服了零样本翻译的缺陷。我们为达罗毗荼-达罗毗荼多语翻译构建单编码器-解码器神经机器翻译系统并执行零样本翻译。我们比较了数据量与零样本精度的权衡,并评估了我们的基础方法相对于当前最优基于枢纽方法的性能。我们还通过基于最优传输的技术限制词汇量,检验了形态丰富语言需要大词汇量的理论。我们的模型在仅以 50% 语言方向训练时,取得了与大规模基于枢纽模型相差 3 BLEU 以内的分数。

关键词

引用

@article{arxiv.2308.05574,
  title  = {Exploring Linguistic Similarity and Zero-Shot Learning for Multilingual Translation of Dravidian Languages},
  author = {Danish Ebadulla and Rahul Raman and S. Natarajan and Hridhay Kiran Shetty and Ashish Harish Shenoy},
  journal= {arXiv preprint arXiv:2308.05574},
  year   = {2023}
}