HaploOmni:用于多模态视频理解与生成的统一单 Transformer
计算机视觉与模式识别
2025-06-04 v1 人工智能
摘要
随着语言模型的发展,统一的多模态理解与生成取得了显著进展,模型架构正从分离组件向统一单模型框架演进。本文探索了一种高效的训练范式,以构建用于统一多模态理解与生成的单一 Transformer。具体而言,我们提出了一种利用先验知识扩展能力的多模态预热策略。为解决跨模态兼容性挑战,我们引入了特征预缩放和多模态 AdaLN 技术。整合所提出的技术,我们提出了 HaploOmni,一种新的单一多模态 Transformer。在有限的训练成本下,HaploOmni 在多个图像和视频理解与生成基准上,取得了优于先进统一模型的竞争力表现。所有代码将公开于 https://github.com/Tencent/HaploVLM。
引用
@article{arxiv.2506.02975,
title = {HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation},
author = {Yicheng Xiao and Lin Song and Rui Yang and Cheng Cheng and Zunnan Xu and Zhaoyang Zhang and Yixiao Ge and Xiu Li and Ying Shan},
journal= {arXiv preprint arXiv:2506.02975},
year = {2025}
}