利用 TTS 合成数据增强 ASR 的自精炼框架
计算与语言
2025-06-17 v2 人工智能
声音
音频与语音处理
摘要
我们提出了一个仅使用无标签数据集即可增强自动语音识别(ASR)性能的自精炼框架。该过程首先利用现有的 ASR 模型在无标注语音上生成伪标签,随后使用这些伪标签训练一个高保真度的文本转语音(TTS)系统。接着,合成的语音-文本对被自举注入原始 ASR 系统,从而完成闭环的自我改进循环。我们在台湾普通话语音上验证了该框架的有效性。利用 6,000 小时的无标签语音、适量的文本数据以及来自 AI 模型的合成内容,我们将 Whisper-large-v2 适配为一个专门模型 Twister。与 Whisper 相比,Twister 在普通话基准上将错误率降低了 20%,在普通话-英语语码转换基准上降低了 50%。结果凸显了该框架作为伪标签自蒸馏方法的一种极具吸引力的替代方案,并为在低资源或特定领域环境下提升 ASR 性能提供了一条实用途径。
引用
@article{arxiv.2506.11130,
title = {A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data},
author = {Cheng-Kang Chou and Chan-Jan Hsu and Ho-Lam Chung and Liang-Hsuan Tseng and Hsi-Chun Cheng and Yu-Kuan Fu and Kuan Po Huang and Hung-Yi Lee},
journal= {arXiv preprint arXiv:2506.11130},
year = {2025}
}