JavisDiT++: 用于联合音视频生成的统一建模与优化
计算机视觉与模式识别
2026-02-24 v1 多媒体
声音
摘要
AIGC 正在从文本到图像生成,快速扩展到视频和音频上的高质量多模态合成。在此背景下,联合音视频生成 (JAVG) 已成为一种基本任务,可从文本描述中生成同步且语义对齐的声音和视觉。然而,与先进商业模型(如 Veo3)相比,现有开源方法在生成质量、时间同步性和与人类偏好一致性方面仍存在局限。为弥合这一差距,本文提出了 JavisDiT++,一个简洁且强大的框架,用于 JAVG 的统一建模与优化。首先,我们引入了模块特定的混合专家 (MS-MoE) 设计,既能实现跨模态交互,又能提升单模态生成质量。随后,我们提出了时间对齐 RoPE (TA-RoPE) 策略,以实现音频和视频标记之间的显式、帧级同步。此外,我们开发了音视频直接偏好优化 (AV-DPO) 方法,以在质量、一致性和同步性维度上将模型输出与人类偏好对齐。基于 Wan2.1-1.3B-T2V 构建,我们的模型仅需约 100 万条公开训练数据,即可在定性和定量评估中显著优于先前方法。我们进行了详尽的消融研究,以验证我们所提出模块的有效性。所有代码、模型和数据集已在 https://JavisVerse.github.io/JavisDiT2-page 上发布。
引用
@article{arxiv.2602.19163,
title = {JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation},
author = {Kai Liu and Yanhao Zheng and Kai Wang and Shengqiong Wu and Rongjunchen Zhang and Jiebo Luo and Dimitrios Hatzinakos and Ziwei Liu and Hao Fei and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2602.19163},
year = {2026}
}
备注
Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page