TADA! 通过激活引导调控音频扩散模型
声音
2026-05-20 v2 机器学习
摘要
音频扩散模型能够从文本合成高保真音乐,然而,实现对特定音乐属性的精细控制仍然具有挑战性,因为其表征高层概念的内部机制尚不明确。在这项工作中,我们使用激活修补技术来证明,当前的音频扩散架构存在一个语义瓶颈,即一个小的、共享的连续注意力层子集控制着不同的音乐概念,例如特定乐器、人声或流派的存在。在此基础上,我们系统地评估了广泛的引导范式,将激活引导与提示级、分数空间和权重空间干预进行比较,分析了引导机制与干预位点之间的相互作用。我们新的基准测试,在大量用户研究的支持下,证明了局部激活引导在音频概念调制方面确立了新的最先进水平。
引用
@article{arxiv.2602.11910,
title = {TADA! Tuning Audio Diffusion Models through Activation Steering},
author = {Łukasz Staniszewski and Katarzyna Zaleska and Mateusz Modrzejewski and Kamil Deja},
journal= {arXiv preprint arXiv:2602.11910},
year = {2026}
}
备注
Preprint