重新审视同声机器翻译测试集的合理性
计算与语言
2023-03-14 v2
摘要
同声机器翻译(SimulMT)模型在源句结束前就开始翻译,使得译文与源句呈单调对齐。然而,通用的全句翻译测试集是通过对整句源句进行离线翻译获得的,并非为 SimulMT 评估而设计,这使我们重新思考这是否会低估 SimulMT 模型的性能。本文基于 MuST-C 英中测试集人工标注了一个单调测试集,记为 SiMuST-C。我们的人工评估确认了所标注测试集的可接受性。在三种不同 SimulMT 模型上的评估验证了在我们的测试集上可以缓解低估问题。进一步的实验表明,在自动提取的单调训练集上微调可使 SimulMT 模型提升多达 3 个 BLEU 点。
引用
@article{arxiv.2303.00969,
title = {Rethinking the Reasonability of the Test Set for Simultaneous Machine Translation},
author = {Mengge Liu and Wen Zhang and Xiang Li and Jian Luan and Bin Wang and Yuhang Guo and Shuoying Chen},
journal= {arXiv preprint arXiv:2303.00969},
year = {2023}
}
备注
Accepted by 48th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023)