Audio ControlNet:用于细粒度音频生成与编辑
声音
2026-02-05 v1 人工智能
计算与语言
多媒体
摘要
我们研究细粒度文本到音频(T2A)生成任务。虽然最近的模型可以合成高质量的音频,但往往缺乏对声音强度、音调和声音事件等属性的精确控制。不同于先前的方法需要为特定控制类型重新训练模型,我们提出在预训练的T2A主干模型上训练ControlNet模型,以实现对声音强度、音调和事件卷的可控生成。我们引入两种设计,T2A-ControlNet和T2A-Adapter,发现T2A-Adapter模型结构更高效且控制能力强。仅需3800万额外参数,T2A-Adapter在AudioSet-Strong上的事件级别和段落级别F1分数均达到最先进水平。我们进一步将该框架扩展到音频编辑,提出T2A-Editor用于在指令指定的时间位置插入和删除音频事件。模型、代码、数据集管道和基准将发布,以支持可控音频生成和编辑的未来研究。
关键词
引用
@article{arxiv.2602.04680,
title = {Audio ControlNet for Fine-Grained Audio Generation and Editing},
author = {Haina Zhu and Yao Xiao and Xiquan Li and Ziyang Ma and Jianwei Yu and Bowen Zhang and Mingqi Yang and Xie Chen},
journal= {arXiv preprint arXiv:2602.04680},
year = {2026}
}