基于流匹配零样本语音合成的说话人相似度时间层自适应对齐
音频与语音处理
2026-03-18 v3
摘要
流匹配 (Flow-Matching) 基于的零样本文本语音合成 (TTS) 系统表现出高质量的语音合成和稳健的泛化能力。然而,由于该框架缺乏针对说话人的显式监督,系统的说话人表示能力仍未得到充分探索。为此,我们对说话人信息分布进行经验性分析,揭示其在时间步和网络层之间的非均匀分配,凸显了需要自适应说话人对齐的必要性。因此,我们提出 Time-Layer Adaptive Speaker Alignment (TLA-SA),一种通过联合利用时序和层次变异来增强说话人一致性的策略。实验结果表明,TLA-SA 在面向科研和工业规模的数据集上显著提升了说话人相似度,并在包括基于解码器-only 语言模型 (LM) 和自由 TTS 系统在内的多种模型架构中获得良好泛化。本文提供了一个演示。
引用
@article{arxiv.2511.09995,
title = {Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS},
author = {Haoyu Li and Mingyang Han and Yu Xi and Dongxiao Wang and Hankun Wang and Haoxiang Shi and Boyu Li and Jun Song and Bo Zheng and Shuai Wang and Kai Yu},
journal= {arXiv preprint arXiv:2511.09995},
year = {2026}
}
备注
Submitted to INTERSPEECH 2026