迭代微分: 用于零样本语音合成评估的判别性与可靠性提升
声音
2026-03-26 v1
摘要
现代零样本语音合成(TTS)模型的可靠评估仍然具有挑战性。主观测试成本高昂且难以复现,而客观指标常常会饱和,难以区分SOTA系统。为此,我们提出了Iterate to Differentiate (I2D),一种递归合成语音的评估框架,该框架使用模型自身的输出作为参考。高质量模型对由迭代合成引起的分布迁移更不敏感,导致性能衰减较慢。I2D利用这种差异化衰减来放大性能差距并揭示鲁棒性。通过聚合跨迭代的客观指标,I2D提高了判别性和与人类判断的一致性,将系统级SRCC从0.118提高到0.464。在中文、英文和情感数据集上的11个模型实验表明,I2D能够为零样本TTS提供更可靠的自动化评估。
引用
@article{arxiv.2603.24430,
title = {Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation},
author = {Shengfan Shen and Di Wu and Xingchen Song and Dinghao Zhou and Liumeng Xue and Meng Meng and Jian Luan and Shuai Wang},
journal= {arXiv preprint arXiv:2603.24430},
year = {2026}
}
备注
submitted to Interspeech 2026, under review