面向 WildSpoof 2026 TTS Track 的自净流匹配鲁棒语音合成训练
声音
2025-12-22 v1 人工智能
摘要
本文提出了为 WildSpoof 挑战 TTS Track 开发的一种轻量级语音合成 (TTS) 系统。我们对最近发布的开源权重 TTS 模型 Supertonic 进行微调,采用自净流匹配 (Self-Purifying Flow Matching, SPFM) 以适应野生语音。SPFM 通过比较每个样本的条件流匹配损失和无条件流匹配损失来缓解标签噪声,将可疑的文本-语音对路由到无条件训练中,同时仍利用其声学信息。最终得到的模型在所有参赛队队中实现了最低的词错误率 (Word Error Rate, WER),在 UTMOS 和 DNSMOS 等感知指标中排名第二。这些发现表明,结合 SPFM 这类显式噪声处理机制,像 Supertonic 这样高效的开源权重架构可以有效适应多样化的真实语音条件。
关键词
引用
@article{arxiv.2512.17293,
title = {Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track},
author = {June Young Yi and Hyeongju Kim and Juheon Lee},
journal= {arXiv preprint arXiv:2512.17293},
year = {2025}
}
备注
2 pages, preprint, This work has been submitted to the IEEE for possible publication. Submitted to ICASSP 2026 SPGC (WildSpoof Challenge, TTS track)