用于 TTS 模型事后韵律与误发音纠正的反事实激活编辑
声音
2025-06-03 v1 人工智能
音频与语音处理
摘要
文本到语音(TTS)的最新进展显著提升了语音自然度,增加了对精确韵律控制和误发音纠正的需求。现有的韵律操作方法通常依赖专门的模块或额外训练,限制了其事后调整的能力。同样,传统的误发音纠正依赖字素到音素字典,使其在低资源环境下不太实用。我们引入了反事实激活编辑,这是一种与模型无关的方法,通过操纵预训练 TTS 模型中的内部表示来实现韵律和发音的事后控制。实验结果表明,我们的方法能有效调整韵律特征并纠正误发音,同时保持合成质量。这为无需重新训练的 TTS 输出推理时优化打开了大门,弥合了预训练 TTS 模型与可编辑语音合成之间的差距。
引用
@article{arxiv.2506.00832,
title = {Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models},
author = {Kyowoon Lee and Artyom Stitsyuk and Gunu Jho and Inchul Hwang and Jaesik Choi},
journal= {arXiv preprint arXiv:2506.00832},
year = {2025}
}
备注
Accepted at Interspeech 2025