JavisDiT:基于层次时空同步先验的联合音视频扩散变换器
计算机视觉与模式识别
2026-02-24 v2 人工智能
声音
音频与语音处理
摘要
本文介绍 JavisDiT,一种用于同步音视频生成(JAVG)的新型联合音视频扩散变换器。基于强大的扩散变换器(DiT)架构,JavisDiT 在统一框架中从开放式用户提示词同时生成高质量的音频和视频内容。为确保音视频同步,我们引入了通过层次空间时间同步先验估计器(HiST-Sypo)实现的细粒度时空对齐机制。该模块提取全局和细粒度时空先验,指导视觉和听觉组件之间的同步。此外,我们提出了一个新的基准,JavisBench,包含 10,140 个高质量文本描述的有声视频,侧重于多样化且复杂真实场景下的同步评估。进一步地,我们专门设计了一个衡量生成音视频对同步性的鲁棒性指标。实验结果表明,JavisDiT 在确保高质量生成和精确同步方面显著优于现有方法,为 JAVG 任务树立了新标准。我们的代码、模型和数据均可在 https://javisverse.github.io/JavisDiT-page/ 获取。
引用
@article{arxiv.2503.23377,
title = {JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization},
author = {Kai Liu and Wei Li and Lai Chen and Shengqiong Wu and Yanhao Zheng and Jiayi Ji and Fan Zhou and Jiebo Luo and Ziwei Liu and Hao Fei and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2503.23377},
year = {2026}
}
备注
Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/