VisionLLM v2:百级视觉语言任务的端到端通用多模态大语言模型
计算机视觉与模式识别
2025-01-03 v3
摘要
我们提出 VisionLLM v2,一个端到端的通用多模态大模型(MLLM),统一了视觉感知、理解和生成。不同于传统 MLLM 仅限于文本输出的做法,VisionLLM v2 大幅拓展了应用范围。它不仅在常规视觉问答(VQA)中表现出色,还在开放式、跨域的视觉任务中,如目标定位、姿态估计以及图像生成与编辑中表现卓越。为此,我们提出一种新的信息传输机制称为“超链接”(super link),作为连接 MLLM 与任务特定解码器的媒介。它不仅允许 MLLM 与多个下游解码器之间进行任务信息和梯度反馈的灵活传输,还有效解决了多任务场景中的训练冲突。此外,为支持多样化的任务,我们仔细收集并梳理了来自数百个公开视觉和视觉语言任务的训练数据。如此一来,我们的模型能够在数百个视觉语言任务上进行端到端联合训练,并通过不同的用户提示在共享参数下对这些任务进行泛化,实现与任务特定模型相当的性能。我们相信 VisionLLM v2 将为 MLLM 的泛化提供新的视角。
引用
@article{arxiv.2406.08394,
title = {VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks},
author = {Jiannan Wu and Muyan Zhong and Sen Xing and Zeqiang Lai and Zhaoyang Liu and Zhe Chen and Wenhai Wang and Xizhou Zhu and Lewei Lu and Tong Lu and Ping Luo and Yu Qiao and Jifeng Dai},
journal= {arXiv preprint arXiv:2406.08394},
year = {2025}
}
备注
44 pages