采样、翻译、重组:利用音频对齐进行端到端语音翻译中的数据增强
计算与语言
2023-06-12 v1 音频与语音处理
摘要
端到端语音翻译依赖于将源语言语音输入与相应目标语言翻译配对的数据。此类数据素来稀缺,使得通过回译或知识蒸馏进行合成数据增强成为端到端训练的必要组成部分。本文提出一种新颖的数据增强方法,利用音频对齐、语言学属性与翻译。首先,我们通过从存储文本与音频数据的后缀记忆中采样来增强转写文本。其次,我们翻译增强后的转写文本。最后,我们重组拼接的音频段与生成的翻译。除训练一个MT系统外,我们仅使用基本的现成组件而无需微调。在与知识蒸馏资源需求相近的同时,加入我们的方法在CoVoST 2的五个语对上分别带来最高0.9和1.1 BLEU点的持续提升,在Europarl-ST的两个语对上亦然。
引用
@article{arxiv.2203.08757,
title = {Sample, Translate, Recombine: Leveraging Audio Alignments for Data Augmentation in End-to-end Speech Translation},
author = {Tsz Kin Lam and Shigehiko Schamoni and Stefan Riezler},
journal= {arXiv preprint arXiv:2203.08757},
year = {2023}
}
备注
Accepted at ACL 2022