Show-o2:改进的原生统一多模态模型
计算机视觉与模式识别
2025-09-23 v3
摘要
本文提出改进的原生统一多模态模型,即 Show-o2,利用自回归建模和流匹配。基于三维因果变分自编码器空间,构建统一的视觉表示,通过空间 (-时间) 融合的双路径实现跨图像和视频模态的可扩展性,同时确保有效的多模态理解和生成。基于语言模型,原生地将自回归建模和流匹配分别应用于语言头和流头,以促进文本标记预测和图像/视频生成。设计了两阶段训练配方,以有效学习并扩展至更大模型。结果表明,Show-o2 模型在包括文本、图像和视频在内的多种多模态理解和生成任务中表现出广泛的 versatility。我们在 https://github.com/showlab/Show-o 上发布了代码和模型。
引用
@article{arxiv.2506.15564,
title = {Show-o2: Improved Native Unified Multimodal Models},
author = {Jinheng Xie and Zhenheng Yang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2506.15564},
year = {2025}
}
备注
NeurIPS 2025. (v3: update to include video understanding, OneIG, and more ablation study results)