中文

自动文本翻译中单语源数据的数量与质量:如果它太好,是否也可以太少?

计算与语言 2024-10-18 v1

摘要

单语数据因易获得且数量庞大,被用于扩大稀缺的平行数据,以训练更好的自动翻译模型。自学习方法即模型学习其自身输出,是一种利用此类数据的做法。然而,已证明如果可用平行数据相对极其稀少,过多的此类数据对模型性能会产生不利影响。本研究探讨了单语数据是否也可能太少,以及这种基于质量的减少是否对翻译模型性能有任何影响。实验表明,在英-德低资源机器翻译中,仅选择基于质量或与测试数据域接近性从而从最有用的额外数据中挑选,往往优于利用所有可用数据。

关键词

引用

@article{arxiv.2410.13783,
  title  = {Quantity vs. Quality of Monolingual Source Data in Automatic Text Translation: Can It Be Too Little If It Is Too Good?},
  author = {Idris Abdulmumin and Bashir Shehu Galadanci and Garba Aliyu and Shamsuddeen Hassan Muhammad},
  journal= {arXiv preprint arXiv:2410.13783},
  year   = {2024}
}