Ovi:基于双主干跨模态融合的音视频生成
多媒体
2025-10-03 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
音视频生成往往依赖复杂的多阶段架构或声音与视觉的顺序合成。我们提出 Ovi,这是一种统一的音视频生成范式,将两种模态建模为单一的生成过程。通过对双DiT模块进行分块跨模态融合,Ovi实现了自然的同步,无需单独的管道或事后对齐。为促进细粒度的多模态融合建模,我们初始化一个音频塔,其架构与强大的预训练视频模型完全相同。在大量原始音频数据上从零训练,音频塔学习生成逼真的音效,以及能够传达丰富说话人身份和情感的语音。通过在庞大的视频语料库上,对视频和音频塔进行联合训练,实现分块交换时间(通过缩放RoPE嵌入)和语义(通过双向跨注意力)进行融合。我们的模型 enables 电影级叙事,包含自然语音和准确匹配语境的音效,生成电影级别的视频片段。所有演示、代码和模型权重均已发布于 https://aaxwaz.github.io/Ovi
引用
@article{arxiv.2510.01284,
title = {Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation},
author = {Chetwin Low and Weimin Wang and Calder Katyal},
journal= {arXiv preprint arXiv:2510.01284},
year = {2025}
}