中文

UniAVGen:基于不对称跨模态互动的统一音视频生成

计算机视觉与模式识别 2026-03-25 v2

摘要

由于缺乏有效的跨模态建模,现有的开源音视频生成方法常常表现出 lip 同步不足和语义一致性不足的问题。为缓解这些缺陷,我们提出了 UniAVGen,一个用于联合音视频生成的统一框架。UniAVGen 建立在双分支联合合成架构中,包含两个平行的扩散转换器(DiT),以构建 cohesive 跨模态潜在空间。其核心在于一种不对称跨模态互动机制,使其能够实现双向、时序对齐的跨注意力,从而确保精确的时空同步和语义一致性。此外,这种跨模态互动还通过一种面部感知调制模块增强,该模块在互动过程中动态优先处理关键区域。为增强推理时的生成保真度,我们额外引入了 Modality-Aware Classifier-Free Guidance 策略,该策略显式放大跨模态关联信号。值得注意的是,UniAVGen 强大的联合合成设计使其能够在单个模型中无缝统一关键音视频任务,如联合音视频生成与续写、视频到音频配音以及音频驱动视频合成。综合实验验证,与传统方法仅用 1.3M 训练样本(相较于 30.1M)相比,UniAVGen 在音视频同步、时音乐器一致性和情感一致性方面均展现出总体优势。

关键词

引用

@article{arxiv.2511.03334,
  title  = {UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions},
  author = {Guozhen Zhang and Zixiang Zhou and Teng Hu and Ziqiao Peng and Youliang Zhang and Yi Chen and Yuan Zhou and Qinglin Lu and Limin Wang},
  journal= {arXiv preprint arXiv:2511.03334},
  year   = {2026}
}

备注

CVPR 2026