SkinAugment:用于自动语音翻译的说话人转换自编码
音频与语音处理
2020-02-28 v1 计算与语言
声音
摘要
我们提出用于自动语音翻译中训练数据增强的说话人转换自编码。该技术直接变换音频序列,从而合成出近似另一说话人声音的音频。在英语法语与英语罗马尼亚语自动语音翻译(AST)任务以及低资源英语自动语音识别(ASR)任务上,我们的方法优于 SpecAugment。进一步,在消融实验中,我们展示了增强数据在数量与多样性两方面的益处。最后,我们表明可将我们的方法与机器翻译文本转录增强结合,获得具有竞争力的端到端 AST 模型,该模型在英语法语 AST 任务上优于一个极强的级联模型。我们的方法具有充分通用性,可应用于其他语音生成与分析任务。
引用
@article{arxiv.2002.12231,
title = {SkinAugment: Auto-Encoding Speaker Conversions for Automatic Speech Translation},
author = {Arya D. McCarthy and Liezl Puzon and Juan Pino},
journal= {arXiv preprint arXiv:2002.12231},
year = {2020}
}
备注
Accepted to ICASSP 2020