基于集成文本到梅尔频谱生成器的纯文本域自适应端到端 ASR
音频与语音处理
2024-07-08 v2 计算与语言
机器学习
声音
摘要
我们提出了一种端到端自动语音识别(ASR)系统,可在转写语音数据、纯文本数据或两者混合上训练。所提模型使用集成的辅助模块进行基于文本的训练。该模块将非自回归多说话人文本到梅尔频谱生成器与基于 GAN 的增强器结合以提升频谱质量。所提系统可在训练期间动态生成梅尔频谱。它可用于通过该域的纯文本数据将 ASR 模型自适应到新域。我们证明,与仅在转写语音上训练的系统相比,所提训练方法显著提升了 ASR 准确率。它在自适应质量与训练速度上也超越了带声码器的级联 TTS 系统。
引用
@article{arxiv.2302.14036,
title = {Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator},
author = {Vladimir Bataev and Roman Korostik and Evgeny Shabalin and Vitaly Lavrukhin and Boris Ginsburg},
journal= {arXiv preprint arXiv:2302.14036},
year = {2024}
}
备注
Accepted to INTERSPEECH 2023