SynerGen-VL:基于视觉专家和标记折叠实现图像理解与生成的协同
计算机视觉与模式识别
2024-12-13 v1
摘要
大型语言模型(LLMs)的卓越成功已扩展到多模态领域,在图像理解和生成方面取得了显著成绩。近期致力于开发集成这些能力的统一多模态大语言模型(MLLMs)的工作显示出有前景的成果。然而,现有方法通常涉及模型架构或训练管道中的复杂设计,增加了模型训练和扩展的难度。本文提出了 SynerGen-VL,一个简单而强大的无编码器 MLLM,能够进行图像理解和生成。为解决现有无编码器统一 MLLM 中识别出的挑战,我们引入了标记折叠机制和基于视觉专家的渐进式对齐预训练策略,这些方法有效地支持高分辨率图像理解,同时降低了训练复杂度。经过在大规模混合图像文本数据上进行统一的下一个标记预测目标训练,SynerGen-VL 实现或超越了现有无编码器统一 MLLM 的性能,参数规模相当或更小,并且缩小了与任务特定最先进模型之间的差距,凸显了通往未来统一 MLLM 的可行路径。我们的代码和模型将发布。
引用
@article{arxiv.2412.09604,
title = {SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding},
author = {Hao Li and Changyao Tian and Jie Shao and Xizhou Zhu and Zhaokai Wang and Jinguo Zhu and Wenhan Dou and Xiaogang Wang and Hongsheng Li and Lewei Lu and Jifeng Dai},
journal= {arXiv preprint arXiv:2412.09604},
year = {2024}
}