中文

SoundWeaver:面向文本到音频扩散模型的语义热启动

声音 2026-03-10 v1 计算机视觉与模式识别 音频与语音处理

摘要

文本到音频扩散模型虽能生成高保真音频,但需进行数十次函数评估(NFE),导致多秒级延迟和吞吐量受限。我们提出 SoundWeaver,首个无训练、模型无关的文本到音频扩散加速服务系统,通过从语义相似的缓存音频进行热启动实现加速。SoundWeaver 包含三个组件:Reference Selector 通过语义和时长感知门控检索并时序对齐缓存候选音频;Skip Gater 动态确定要跳过的 NFE 百分比;轻量级 Cache Manager 通过质量感知驱逐和细化维持缓存实用性。在真实世界音频轨迹上,SoundWeaver 在仅约 1K 条缓存条目下,实现 1.8--3.0 倍延迟降低,同时保持或提升感知质量。

关键词

引用

@article{arxiv.2603.07865,
  title  = {SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving},
  author = {Ayush Barik and Sofia Stoica and Nikhil Sarda and Arnav Kethana and Abhinav Khanduja and Muchen Xu and Fan Lai},
  journal= {arXiv preprint arXiv:2603.07865},
  year   = {2026}
}

备注

Submitted to INTERSPEECH 2026