AudioGen-Omni:用于视频同步音频、语音和歌曲生成的统一多模态扩散变换器
声音
2025-08-08 v4 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
我们提出了 AudioGen-Omni - 一种基于多模态扩散变换器(MMDit)的统一方法,能够生成与输入视频同步的高保真音频、语音和歌曲。AudioGen-Omni 引入一种新颖的联合训练范式,无缝整合大规模视频-文本-音频语料库,使模型能够生成在多模态输入条件下具有丰富语义和多样化声学特征的音频,并且可适应广泛的音频生成任务。AudioGen-Omni 采用统一的歌词-转录编码器,将来自歌曲和口语输入的 grapheme 和 phoneme 编码为密集的帧级表示。通过采用基于 AdaLN 的联合注意力机制,增强了相位对齐的各向异性位置注入(PAAPI),其中对时序结构模态选择性地应用 RoPE,以确保精确且稳健的跨模态对齐。通过解除所有模态的冻结并屏蔽缺失的输入,AudioGen-Omni 缓解了文本冻结范式的语义约束,实现有效的跨模态条件。这种联合训练方法提高了音频质量、语义对齐和唇同步精度,同时在文本到音频/语音/歌曲任务中实现了最先进的结果。以 1.91 秒的推理时间生成 8 秒音频,显著提升了效率和通用性。
引用
@article{arxiv.2508.00733,
title = {AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation},
author = {Le Wang and Jun Wang and Chunyu Qiang and Feng Deng and Chen Zhang and Di Zhang and Kun Gai},
journal= {arXiv preprint arXiv:2508.00733},
year = {2025}
}
备注
12 pages, 2 figures