利用间接训练数据实现端到端自动语音翻译:实践经验
计算与语言
2019-10-23 v2 声音
音频与语音处理
摘要
对于自动语音翻译(AST),端到端方法的表现不及级联模型——后者先以自动语音识别(ASR)转写,再以机器翻译(MT)翻译。性能差距的一个主因是:现有 AST 语料较小,而 ASR 与 MT 两个子系统均存在海量数据集。本工作中,我们评估若干 AST 的数据增强与预训练方法,并在相同数据集上逐一比较。通过对 ASR 转写文本进行翻译的简单数据增强,在英–法增强 LibriSpeech 数据集上最为有效,与可直接利用大量 ASR 和 MT 数据的极强级联系统相比,将性能差距从 8.2 BLEU 缩小至 1.4 BLEU。相同的端到端方法辅以微调,在英–罗 MuST-C 数据集上将差距从 6.7 BLEU 缩小至 3.7 BLEU。除这些结果外,我们给出关于增强与预训练方法的实用建议。最后,我们使用基于 Transformer 的架构将性能差距降至 0.01 BLEU。
引用
@article{arxiv.1909.06515,
title = {Harnessing Indirect Training Data for End-to-End Automatic Speech Translation: Tricks of the Trade},
author = {Juan Pino and Liezl Puzon and Jiatao Gu and Xutai Ma and Arya D. McCarthy and Deepak Gopinath},
journal= {arXiv preprint arXiv:1909.06515},
year = {2019}
}
备注
IWSLT 2019