VITRON:用于理解、生成、分割、编辑的统一像素级视觉大语言模型
计算机视觉与模式识别
2024-12-31 v1 人机交互
摘要
近期视觉大语言模型(LLM)的发展取得了显著进展,但仍面临多模态通用性挑战,如粗粒度实例级理解、对图像和视频的统一支持不足,以及对各种视觉任务的覆盖不充足。本文提出VITRON,一个通用的像素级视觉LLM,旨在实现对静态图像和动态视频的全面理解、生成、分割和编辑。基于LLM主干网络,VITRON集成了针对图像、视频和像素级区域视觉信息的编码器,同时通过后端的领先视觉专家,支持从视觉理解到视觉生成、从低层到高层的多种视觉任务。为确保LLM与后端模块之间高效精确的信息传递,我们提出了一种新颖的混合方法,同时集成离散文本指令和连续信号嵌入。进一步,VITRON设计了各种像素级时空视觉语言对齐学习,以实现最佳的细粒度视觉能力。最后,建议采用跨任务协同模块,以学习最大化任务不变的细粒度视觉特征,增强不同视觉任务之间的协同性。在12个视觉任务上进行评估,VITRON在22个数据集上表现出广泛的能力,涵盖四大主要视觉任务集群。总体而言,本工作阐明了开发更统一的多模态通用模型的巨大潜力。项目主页:https://vitron-llm.github.io/
引用
@article{arxiv.2412.19806,
title = {Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing},
author = {Hao Fei and Shengqiong Wu and Hanwang Zhang and Tat-Seng Chua and Shuicheng Yan},
journal= {arXiv preprint arXiv:2412.19806},
year = {2024}
}
备注
Accepted by NeurIPS 2024