中文

JoVA:用于联合视频-音频生成的统一多模态学习

计算机视觉与模式识别 2025-12-16 v1

摘要

本文提出 JoVA,一个用于联合视频-音频生成的统一框架。尽管近期取得的进展令人鼓舞,但现有方法面临两个关键局限:其一,大多数现有方法仅能生成环境音,缺乏生成与唇部动作同步的人类语音能力;其二,近期尝试的统一人类视频-音频生成通常依赖显式融合或模态特定对齐模块,这引入额外的架构设计,削弱了原始 transformer 模型的简单性。为此,JoVA 在每个 transformer 层级中实现视频和音频 token 之间的 joint self-attention,直接且高效地实现跨模态交互,无需额外对齐模块。此外,为实现高质量 lip-sync, 我们引入一种基于面部关键点检测的简单而有效的 mouth-area loss,增强了训练中对关键唇部区域的监督,同时不牺牲架构的简单性。大量实验表明,JoVA 在唇同步精度、语音质量和整体视频-音频生成保真度方面,均优于或与 audio-driven 和 unified 的最先进方法并列。我们的结果表明,JoVA 是一个优雅且高质量的多模态生成框架。

关键词

引用

@article{arxiv.2512.13677,
  title  = {JoVA: Unified Multimodal Learning for Joint Video-Audio Generation},
  author = {Xiaohu Huang and Hao Zhou and Qiangpeng Yang and Shilei Wen and Kai Han},
  journal= {arXiv preprint arXiv:2512.13677},
  year   = {2025}
}

备注

Project page: \url{https://visual-ai.github.io/jova}