AudioMoG:基于混合指导的音频生成
声音
2026-04-10 v2 人工智能
摘要
扩散式音频生成系统的设计从多种角度进行考察,如数据空间、网络架构和条件技术,而这些创新大多需要模型重新训练。在采样过程中,分类器无条件指导(CFG)被统一采用以通过强化条件对齐来提高生成质量。然而,CFG往往会牺牲多样性,导致次优性能。虽然最近的自指导(AG)方法提出了另一种指导方向,但其直接应用于音频生成仍未达到CFG的水平。本文引入AudioMoG,一种改进的采样方法,用于在不 requiring extensive training resources 的情况下提高文本到音频(T2A)和视频到音频(V2A)生成质量。我们首先分析CFG和AG,考察其在引导扩散模型方面的优势和局限。基于我们的见解,我们引入一种混合指导框架,将多样化的指导信号及其相互作用项(例如无条件差差版本的模型)整合以最大化累积优势。实验表明,在相同的推断速度下,我们的方法在T2A生成的采样步骤中持续优于单一指导,同时在V2A、文本到音乐和图像生成中也显示出优势。演示样本已公开:https://audiomog.github.io。
引用
@article{arxiv.2509.23727,
title = {AudioMoG: Guiding Audio Generation with Mixture-of-Guidance},
author = {Junyou Wang and Zehua Chen and Binjie Yuan and Kaiwen Zheng and Chang Li and Yuxuan Jiang and Jun Zhu},
journal= {arXiv preprint arXiv:2509.23727},
year = {2026}
}
备注
Accepted at ICME 2026