OMG-LLaVA:跨图像级、对象级、像素级推理与理解
计算机视觉与模式识别
2024-10-02 v2
摘要
当前的通用分割方法在像素级图像和视频理解方面表现出强大的能力,但缺乏推理能力,无法通过文本指令进行控制。相比之下,大型视觉语言多模态模型 exhibits powerful vision-based conversation and reasoning capabilities but lack pixel-level understanding and have difficulty accepting visual prompts for flexible user interaction. 本文提出 OMG-LLaVA,一个结合强大像素级视觉理解与推理能力的新型框架。它可以接受各种视觉和文本提示以实现灵活的用户交互。具体而言,我们使用通用分割方法作为视觉编码器,将图像信息、感知先验和视觉提示整合为视觉标记供 LLM 使用。LLM 负责理解用户的文本指令并基于视觉信息提供文本响应和像素级分割结果。我们提出感知先验嵌入以更好地整合感知先验与图像特征。OMG-LLaVA 在单个模型中实现了图像级、对象级和像素级推理与理解, 在多个基准测试中匹配或超越了专用方法的性能。与使用 LLM 将每个专家连接在一起不同,我们的工作旨在对单个编码器、解码器和 LLM 进行端到端训练。代码和模型已发布供进一步研究使用。
引用
@article{arxiv.2406.19389,
title = {OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding},
author = {Tao Zhang and Xiangtai Li and Hao Fei and Haobo Yuan and Shengqiong Wu and Shunping Ji and Chen Change Loy and Shuicheng Yan},
journal= {arXiv preprint arXiv:2406.19389},
year = {2024}
}
备注
NeurIPS-2024. Project page: https://lxtgh.github.io/project/omg_llava/