低资源引导下的可控潜在音频扩散
声音
2026-03-05 v1 人工智能
机器学习
摘要
生成式音频需要细粒度的可控输出,但大多数现有方法需要在特定控制项上重新训练模型,或在推理阶段进行控制(如引导),后者亦可能计算昂贵。通过考察现有引导式控制的瓶颈,尤其是解码器反向传播导致的每步计算成本高,我们引入一种通过选择性 TFG 和潜在控制头部(Latent-Control Heads, LatCHs)实现的引导式方法,使其能够以低计算开销控制潜在音频扩散模型。LatCHs 直接在潜在空间中工作,避免了昂贵的解码步骤,仅需约 7 百万参数和约 4 小时的训练。实验使用 Stable Audio Open 证明在保持生成质量的同时,能够有效控制强度、音调和节拍(以及这些的组合)。该方法在计算成本远低于标准端到端引导的前提下,实现了精度与音频保真度之间的平衡。演示示例可在 https://zacharynovack.github.io/latch/latch.html 查看。
引用
@article{arxiv.2603.04366,
title = {Low-Resource Guidance for Controllable Latent Audio Diffusion},
author = {Zachary Novack and Zack Zukowski and CJ Carr and Julian Parker and Zach Evans and Josiah Taylor and Taylor Berg-Kirkpatrick and Julian McAuley and Jordi Pons},
journal= {arXiv preprint arXiv:2603.04366},
year = {2026}
}
备注
Accepted at ICASSP 2026