基于多分辨率欺骗检测的层次化解码用于离散语音合成
声音
2026-04-14 v2 音频与语音处理
摘要
神经编解码语言模型能够实现高质量的离散语音合成,但其推理过程仍易受到token级瑕疵和分布漂移的影响,导致感知现实性下降。我们提出MSpoof-TTS,一种训练自由的推理框架,通过多分辨率欺骗指导实现零样本合成质量提升。我们引入基于多分辨率的欺骗检测框架,对编解码序列在不同时间粒度上进行评估,以检测局部不一致或不自然的模式。随后将欺骗检测器集成到层次化解码策略中,逐步剔除低质量候选并重新排序假设。这种判别器导向的生成方法无需修改模型参数即可提升鲁棒性。实验结果验证了该框架在稳健高质量编解码语音生成方面的有效性。音频样本可在 https://danny-nus.github.io/MSpoofTTS.github.io/ 查看。
引用
@article{arxiv.2603.05373,
title = {Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection},
author = {Junchuan Zhao and Minh Duc Vu and Ye Wang},
journal= {arXiv preprint arXiv:2603.05373},
year = {2026}
}
备注
7 pages, 3 figures, 3 tables, 2 algorithms