中文

Audio ControlNet:用于细粒度音频生成与编辑

声音 2026-02-05 v1 人工智能 计算与语言 多媒体

摘要

我们研究细粒度文本到音频(T2A)生成任务。虽然最近的模型可以合成高质量的音频,但往往缺乏对声音强度、音调和声音事件等属性的精确控制。不同于先前的方法需要为特定控制类型重新训练模型,我们提出在预训练的T2A主干模型上训练ControlNet模型,以实现对声音强度、音调和事件卷的可控生成。我们引入两种设计,T2A-ControlNet和T2A-Adapter,发现T2A-Adapter模型结构更高效且控制能力强。仅需3800万额外参数,T2A-Adapter在AudioSet-Strong上的事件级别和段落级别F1分数均达到最先进水平。我们进一步将该框架扩展到音频编辑,提出T2A-Editor用于在指令指定的时间位置插入和删除音频事件。模型、代码、数据集管道和基准将发布,以支持可控音频生成和编辑的未来研究。

关键词

引用

@article{arxiv.2602.04680,
  title  = {Audio ControlNet for Fine-Grained Audio Generation and Editing},
  author = {Haina Zhu and Yao Xiao and Xiquan Li and Ziyang Ma and Jianwei Yu and Bowen Zhang and Mingqi Yang and Xie Chen},
  journal= {arXiv preprint arXiv:2602.04680},
  year   = {2026}
}