并非如你所想!基于口译数据评估同声机器翻译
计算与语言
2021-10-12 v1 机器学习
摘要
大多数现有的同声机器翻译(SiMT)系统在离线翻译语料上训练和评估。我们认为 SiMT 系统应当在真实的口译数据上训练和测试。为阐明这一观点,我们提出了一个口译测试集,并对在离线翻译上训练的 SiMT 进行了真实场景下的评估。我们在该测试集以及 3 个现有较小规模语言对上的结果表明,当 SiMT 模型在翻译数据与口译数据上分别评估时,BLEU 分数差异最高可达 13.83。在缺乏口译训练数据的情况下,我们提出了一种翻译到口译(T2I)风格迁移方法,可将现有离线翻译转换为口译风格数据,带来最高 2.8 的 BLEU 提升。然而,评估差距仍然显著,这呼吁构建更适用于评估和开发 SiMT 系统的大规模口译语料库。
引用
@article{arxiv.2110.05213,
title = {It is Not as Good as You Think! Evaluating Simultaneous Machine Translation on Interpretation Data},
author = {Jinming Zhao and Philip Arthur and Gholamreza Haffari and Trevor Cohn and Ehsan Shareghi},
journal= {arXiv preprint arXiv:2110.05213},
year = {2021}
}
备注
EMNLP2021