中文

无需重新训练机器翻译系统的多面数据翻译

计算与语言 2024-12-03 v2 人工智能

摘要

翻译主要语言资源以构建次要语言资源已成为一种广泛使用的方法。特别是在翻译由多个组件组成的复杂数据点时,通常分别翻译每个组件。然而,我们认为这种做法常常忽略了同一数据点内组件之间的相互关系。为了解决这个局限性,我们提出了一种新颖的机器翻译流水线,在实现训练数据的机器翻译时考虑了数据内部关系。在我们的机器翻译流水线中,数据点中的所有组件被连接成一个单一的翻译序列,并在翻译后重构为数据组件。我们引入了催化剂语句(CS)来增强数据内部关系,以及指示符标记(IT)来帮助将翻译后的序列分解为各自的数据组件。通过我们的方法,我们在翻译质量本身以及作为训练数据的有效性方面都取得了显著的改进。与分别翻译每个数据组件的传统方法相比,我们的方法产生了更好的训练数据,在XGLUE基准测试中,对于网页排名(WPR)任务,训练模型的性能提高了2.690分,对于问题生成(QG)任务提高了0.845分。

关键词

引用

@article{arxiv.2404.16257,
  title  = {Translation of Multifaceted Data without Re-Training of Machine Translation Systems},
  author = {Hyeonseok Moon and Seungyoon Lee and Seongtae Hong and Seungjun Lee and Chanjun Park and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2404.16257},
  year   = {2024}
}

备注

Accepted to EMNLP2024 findings