纯合人工训练数据对不同自动语音识别架构的影响
计算与语言
2024-10-29 v2 机器学习
声音
音频与语音处理
摘要
在本工作中,我们评估了合成数据用于训练自动语音识别(ASR)的实用性。我们使用 ASR 训练数据训练一个类似 FastSpeech-2 的文本语音合成(TTS)系统。借助该 TTS 系统,我们复现原始训练数据,仅使用合成数据训练 ASR 系统。对于 ASR,我们使用三种不同的架构:基于注意力的编码器-解码器、深度神经网络隐藏 Markov 模型和高斯混合隐藏 Markov 模型,显示了这些模型对合成数据生成的不同灵敏度。为扩展以前的工作,我们对合成与真实训练数据在 ASR 中的有效性进行了多个消融研究。特别地,我们关注随着改变说话人嵌入或模型规模而变化的合成与真实训练数据之间差距。对于后者,我们表明即使训练分数显示出现过拟合,TTS 模型也能良好地泛化。
关键词
引用
@article{arxiv.2407.17997,
title = {On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures},
author = {Benedikt Hilmes and Nick Rossenbach and and Ralf Schlüter},
journal= {arXiv preprint arXiv:2407.17997},
year = {2024}
}
备注
Published at the SynData4GenAI 2024 workshop