u-LLaVA:通过大语言模型统一多模态任务
计算机视觉与模式识别
2024-08-29 v4
摘要
多模态大语言模型(MLLM)的最新进展在视觉理解方面带来了实质性提升,主要由精细的模态对齐策略驱动。然而,主流方法优先关注全局或区域理解,对细粒度、像素级任务的关注较少。为弥补这一不足,我们提出u-LLaVA,一种创新的统一多任务框架,其整合像素、区域和全局特征以精炼MLLM的感知能力。我们首先利用高效的模态对齐方法,借助图像与视频数据集增强模型在不同视觉语境下的基础理解。随后,提出一种带有任务特定投影器与解码器的联合指令微调方法,用于端到端下游训练。此外,本工作贡献了一个新颖的基于掩码的多任务数据集,包含277K样本,旨在挑战并评估MLLM的细粒度感知能力。整体框架简洁、有效,并在多个基准上取得最先进性能。我们亦在 https://github.com/OPPOMKLab/u-LLaVA 公开了模型、数据与代码。
引用
@article{arxiv.2311.05348,
title = {u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model},
author = {Jinjin Xu and Liwu Xu and Yuzhe Yang and Xiang Li and Fanyi Wang and Yanchun Xie and Yi-Jie Huang and Yaqian Li},
journal= {arXiv preprint arXiv:2311.05348},
year = {2024}
}