零样本文本到语音中度量诱导离散流匹配的动力学最优调度与矩校正
音频与语音处理
2026-05-12 v1 人工智能
机器学习
摘要
度量诱导离散流匹配(MI-DFM)利用 token-潜空间几何进行离散生成,但其实际应用受限于两个问题:需要超参数搜索的启发式调度器,以及其一阶连续时间马尔可夫链(CTMC)求解器带来的有限步路径跟踪误差。我们解决了这两个问题。首先,我们推导了预定标量参数化概率路径的动力学最优调度器,并将其在 MI-DFM 中实例化为一种无需训练的数值调度,以恒定的 Fisher-Rao 速度遍历路径。其次,我们引入了有限步矩校正,在保持 CTMC 跳跃目标分布的同时调整跳跃概率。我们在基于编解码器的零样本文本到语音(TTS)上验证了所得方法 GibbsTTS。在统一架构和大规模数据集的受控比较下,GibbsTTS 取得了最佳客观自然度,并在主观评估中优于掩蔽离散生成基线。此外,与评估的最先进 TTS 系统相比,GibbsTTS 表现出极强的说话人相似度,在四个测试集中的三个上取得了最高相似度,在第四个上排名第二。项目页面:https://ydqmkkx.github.io/GibbsTTSProject
引用
@article{arxiv.2605.09386,
title = {Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech},
author = {Dong Yang and Yiyi Cai and Haoyu Zhang and Yuki Saito and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2605.09386},
year = {2026}
}
备注
Under Review