一种用于为语音识别应用建模语音中自然扰动的 Cycle-GAN 方法
音频与语音处理
2019-12-25 v1 计算与语言
声音
摘要
由说话人情绪和生理状态引起的音频信号中的自然扰动会显著降低自动语音识别(ASR)系统的性能。本文提出一种基于循环一致生成对抗网络(CycleGAN)的前端,将自然扰动的语音转换为正常语音,从而提升 ASR 系统的鲁棒性。CycleGAN 模型在非平行的扰动语音与正常语音样本上训练。在自发笑声语音和嘎裂语音数据集上的实验表明,与使用原始扰动语音直接进行识别相比,使用基于 CycleGAN 的前端所得语音使四种不同 ASR 系统的性能均得到提升。对笑声扰动语音及所提前端生成语音的特征可视化进一步证明了我们方法的有效性。
引用
@article{arxiv.1912.11151,
title = {A Cycle-GAN Approach to Model Natural Perturbations in Speech for ASR Applications},
author = {Sri Harsha Dumpala and Imran Sheikh and Rupayan Chakraborty and Sunil Kumar Kopparapu},
journal= {arXiv preprint arXiv:1912.11151},
year = {2019}
}
备注
7 pages, 3 figures, ICASSP-2019