面向受限文本大规模并行翻译至低资源语言的主动学习
计算与语言
2021-10-28 v3
摘要
我们将一个预先已知且以多种语言可用的封闭文本翻译为一种全新的、极度低资源的语言。多数人工翻译工作采用基于部分的方法按顺序翻译连续的页/章,这可能并不适合机器翻译。我们比较了优化文本局部连贯性的基于部分的方法与提升文本全局覆盖率的随机采样方法。我们的结果表明随机采样方法表现更优。当在来自圣经的约 1,000 行种子语料上训练并测试圣经其余部分(约 30,000 行)时,以英语作为模拟低资源语言,随机采样带来 +11.0 BLEU 的性能提升;以东部波科姆奇语(一种玛雅语言)则带来 +4.9 BLEU 的提升。此外,我们比较了通过迭代以递增量人工后期编辑数据更新机器翻译模型的三种方式。我们发现,在词汇更新后不加自监督地将新后期编辑数据加入训练表现最佳。我们提出了一种使人与机器无缝协作以将封闭文本翻译为极度低资源语言的算法。
引用
@article{arxiv.2108.07127,
title = {Active Learning for Massively Parallel Translation of Constrained Text into Low Resource Languages},
author = {Zhong Zhou and Alex Waibel},
journal= {arXiv preprint arXiv:2108.07127},
year = {2021}
}