中文

恢复句子级双语文本的文档标注信息

计算与语言 2024-06-07 v1

摘要

数据可得性限制了给定任务的范围。在机器翻译中,历史模型无法处理更长的上下文,因此缺乏文档级数据集的影响较小。然而,尽管长序列方法的出现,但我们仍停留在句子级范式,且缺乏足以充分处理上下文感知机器翻译的数据。大多数大规模数据集经过处理管道,丢弃了文档级元数据。在本工作中,我们为德、法、西、意、波、葡语(配对英语)三个大型数据集(ParaCrawl、News Commentary、Europarl)重建文档级信息。随后,我们引入一种作为传统双语过滤器备选的文档级过滤技术。我们呈现此过滤方法的分析,表明该方法倾向于选择与上下文一致的翻译,而非可能是在句子级机器翻译中产生的翻译。最后我们在这些更长的上下文上训练模型,证明在不损害句子级翻译质量的前提下实现文档级翻译的提升。我们将数据集 ParaDocs 以及随模型一起发布给社区。

关键词

引用

@article{arxiv.2406.03869,
  title  = {Recovering document annotations for sentence-level bitext},
  author = {Rachel Wicks and Matt Post and Philipp Koehn},
  journal= {arXiv preprint arXiv:2406.03869},
  year   = {2024}
}

备注

ACL 2024 Findings