Omni2Sound:面向统一视频-文本到音频生成的探索
声音
2026-04-30 v3 计算机视觉与模式识别
多媒体
摘要
构建统一模型集成视频到音频(V2A)、文本到音频(T2A)以及联合视频-文本到音频(VT2A)生成,具有显著的应用灵活性,但面临两个尚未探索的基础性挑战:(1)高质量音频描述数据稀缺,导致多模态条件之间语义冲突严重;(2)跨任务和同一任务内的竞争,表现为不利的V2A-T2A性能权衡以及VT2A任务中的模态偏好。首先,为解决数据稀缺问题,我们引入SoundAtlas,一个大规模数据集(47万对),显著优于现有基准,甚至优于人类专家。基于我们新颖的智能体流程,该数据集整合了视觉到语言压缩以缓解MLLMs的视觉偏见,采用初级-高级智能体接力实现5倍成本降低,并通过严格的事后过滤确保保真度。因此,SoundAtlas提供语义丰富、时序细致且具备紧密V-A-T对齐的描述。其次,我们提出Omni2Sound,一个支持灵活输入模态的统一VT2A扩散模型。为解决内在的跨任务和同一任务内竞争,我们设计三阶段的多任务渐进式训练计划,将跨任务竞争转化为联合优化,并缓解VT2A任务中的模态偏好,同时保持音频-视觉对齐和幕后音频生成的忠实性。最后,我们构建VGGSound-Omni,用于统一评估的全面基准,包括具有挑战性的幕后轨迹。采用标准DiT骨干网络,Omni2Sound在所有三个任务中实现统一的最先进技术,展示了在异构输入条件下强大的跨基准泛化能力。
引用
@article{arxiv.2601.02731,
title = {Omni2Sound: Towards Unified Video-Text-to-Audio Generation},
author = {Yusheng Dai and Zehua Chen and Yuxuan Jiang and Baolong Gao and Qiuhong Ke and Jianfei Cai and Jun Zhu},
journal= {arXiv preprint arXiv:2601.02731},
year = {2026}
}