基于激活引导的面向方言中性化的零样文本到语音
音频与语音处理
2026-03-09 v1
摘要
零样文本到语音(TTS)模型可以生成既捕获参考说话人语音 timbre又捕获方言的语音。然而,如何在输出中解耦这些属性仍然具有挑战性,因为输出常常同时继承方言和 timbre。本研究引入一种新颖的、后处理且无需训练的方法,通过推理时激活引导中和方言而保留说话人的原始 timbre。我们首先离线提取特定层级的"引导向量”,这些向量源自TTS模型在带方言和本土语音之间的内部激活差异。在推理期间,应用引导向量以引导模型生成方言中性化、保留 timbre的语音。实证结果表明,所提出的引导向量有效缓解了输出方言,并对未见的带方言说话人具有强大的可泛化性,为无方言语音克隆提供了实用解决方案。
引用
@article{arxiv.2603.05977,
title = {Activation Steering for Accent-Neutralized Zero-Shot Text-To-Speech},
author = {Mu Yang and John H. L. Hansen},
journal= {arXiv preprint arXiv:2603.05977},
year = {2026}
}
备注
Submitted to Interspeech 2026