基于细粒度奖励的语音识别模型提升文本转语音合成质量
音频与语音处理
2025-11-25 v1 计算与语言
摘要
近期文本转语音(text-to-speech, TTS)技术进展使模型能够克隆任意未见说话人并合成高质量、自然的语音。然而,评估方法滞后于发展:典型的平均意见分数(mean opinion score, MOS)估计器对整个句子进行回归,而实际失效通常发生在少数问题词语上。我们观察到,编码解码语音识别模型(如 Whisper)通过交叉注意力机制暴露出语音与文本之间的词级不匹配,提供细粒度的奖励信号。基于此,我们引入基于 ASR 的注意力奖励的词级 TTS 对齐方法(Word-level TTS Alignment by ASR-driven Attentive Reward, W3AR)。在无需显式奖励标注的情况下,W3AR 利用预训练语音识别模型的注意力机制驱动更细粒度的对齐和优化,提升由 TTS 模型预测的序列质量。实验表明,W3AR 提升了现有 TTS 系统的质量,并增强了对未见说话人的零样本鲁棒性。更广泛地说,我们的结果表明一种简单的方法:理解模型可作为评估器,为优化提供信息丰富、细粒度的反馈。
引用
@article{arxiv.2511.17555,
title = {Speech Recognition Model Improves Text-to-Speech Synthesis using Fine-Grained Reward},
author = {Guansu Wang and Peijie Sun},
journal= {arXiv preprint arXiv:2511.17555},
year = {2025}
}
备注
The paper makes an important contribution to the very challenging problem of training TTS models, with a novel application of reinforcement learning and demonstrating convincing improvements