关于在端到端语音翻译中使用 SpecAugment
计算与语言
2019-11-21 v1 机器学习
音频与语音处理
摘要
本工作研究了一种简单的数据增强技术 SpecAugment 在端到端语音翻译中的应用。SpecAugment 是一种直接应用于音频输入特征的低成本实现方法,其由掩蔽频率通道块和/或时间步块组成。我们将 SpecAugment 应用于端到端语音翻译任务,并通过在一定程度上缓解过拟合,在 LibriSpeech Audiobooks En->Fr 上取得最高 +2.2\% \BLEU 的提升,在 IWSLT TED-talks En->De 上取得 +1.2% 的提升。我们还考察了该方法在各种数据场景下的有效性,并表明该方法在不同数据条件下无论训练数据量多少都能带来显著改进。
关键词
引用
@article{arxiv.1911.08876,
title = {On Using SpecAugment for End-to-End Speech Translation},
author = {Parnia Bahar and Albert Zeyer and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:1911.08876},
year = {2019}
}
备注
8 pages, International Workshop on Spoken Language Translation (IWSLT), Hong Kong, China, November 2019