基于能量-评分和辅助上下文蒸馏的快速文本到音频生成:一步采样
数值分析
2026-05-08 v2 数值分析
摘要
自回归(AR)模型带扩散头最近在文本到音频任务中取得了强大的性能,但其迭代解码和多步采样过程带来高延迟问题。为缓解此瓶颈,我们提出一种结合能量距离训练目标和表示级蒸馏的一步采样框架。能量评分头直接将高斯噪声映射到音频潜在空间,无需代价高昂的递归扩散采样过程;而从掩码自回归(MAR)文本到音频模型蒸馏,保留扩散训练期间所学的强条件。AudioCaps 基准测试上,我们的方法在客观和主观指标上均优于 ConsistencyTTA、SoundCTM、AudioLCM 和 AudioTurbo等既有一步基线,同时显著缩小与多步采样的 AR 扩散系统之间的质量差距。与最先进的 AR 扩散系统 IMPACT 相比,我们的方法在批量推理时实现了最高 x 的加速,同时保持高度具竞争力的音频质量。这些结果表明,能量距离训练与表示级蒸馏的结合为快速高质量的文本到音频合成提供了有效方案。
引用
@article{arxiv.2605.00328,
title = {Spectral decomposition of $(\star, \epsilon)$-palindromic matrix polynomial and its applications},
author = {Kang Zhao and Xin Wang and Xiaoxiao Ma},
journal= {arXiv preprint arXiv:2605.00328},
year = {2026}
}