中文

OCC-MLLM:赋能多模态大语言模型理解遮挡对象

计算机视觉与模式识别 2024-10-03 v1

摘要

现有大规模视觉语言多模态模型在理解遮挡对象方面存在差距。当前最先进的多模态模型无法通过通用视觉编码器为视觉-语言多模态模型提供令人满意的遮挡对象描述。另一个挑战是包含大量遮挡对象的图像-文本对数据集数量有限。因此,我们引入了一个新型多模态模型,通过设计新颖的视觉编码器来理解RGB图像中的遮挡对象。我们还引入了一个大规模视觉-语言配对数据集,用于训练大规模视觉-语言多模态模型并理解遮挡对象。我们开始与最先进模型进行实验比较。

关键词

引用

@article{arxiv.2410.01261,
  title  = {OCC-MLLM:Empowering Multimodal Large Language Model For the Understanding of Occluded Objects},
  author = {Wenmo Qiu and Xinhan Di},
  journal= {arXiv preprint arXiv:2410.01261},
  year   = {2024}
}

备注

Accepted by CVPR 2024 T4V Workshop (5 pages, 3 figures, 2 tables)