JavisGPT:用于有声视频理解与生成的统一多模态大语言模型
计算机视觉与模式识别
2026-01-05 v2
摘要
本文提出了 JavisGPT,这是首个用于联合视听(JAV)理解与生成的统一多模态大语言模型(MLLM)。JavisGPT 具有简洁的编码器-LLM-解码器架构,其中包含用于时空视听融合的 SyncFusion 模块以及同步感知的可学习查询,以桥接预训练的 JAV-DiT 生成器。这种设计使得能够根据多模态指令实现时间连贯的视音频理解与生成。我们设计了一个有效的三阶段训练流程,包括多模态预训练、视听微调和大规模指令微调,以从现有的视觉语言模型中逐步构建多模态理解和生成能力。对于指令微调,我们构建了 JavisInst-Omni,这是一个高质量的指令数据集,包含超过20万条由 GPT-4o 策划的视听文本对话,涵盖多样且多级的理解与生成场景。在 JAV 理解和生成基准上,我们的实验表明 JavisGPT 优于现有的 MLLMs,特别是在复杂和时间同步的场景中。
引用
@article{arxiv.2512.22905,
title = {JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation},
author = {Kai Liu and Jungang Li and Yuchong Sun and Shengqiong Wu and Jianzhang Gao and Daoan Zhang and Wei Zhang and Sheng Jin and Sicheng Yu and Geng Zhan and Jiayi Ji and Fan Zhou and Liang Zheng and Shuicheng Yan and Hao Fei and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2512.22905},
year = {2026}
}
备注
Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT