RegionBLIP:面向整体与区域理解的统一多模态预训练框架
计算机视觉与模式识别
2023-08-07 v1
摘要
在本工作中,我们研究将多模态大语言模型(MLLM)的理解能力扩展到区域物体。为此,我们提出将对应区域物体的特征提取为 LLM 的软提示,这提供了一种直接且可扩展的方法,并消除了对 LLM 微调的需求。为了从规则的图像特征和不规则的点云特征中有效提取区域特征,我们提出了一种新颖且统一的位置辅助特征提取模块。此外,从头训练 MLLM 极为耗时。因此,我们提出增量式扩展现有预训练 MLLM,以理解更多模态及这些模态的区域物体。具体而言,我们冻结来自 BLIP-2(一个出色的 MLLM)的 Q-Former,并为每个新引入的模态优化 Q-Former 和 LLM 中特定于模态的 Lora 参数。对 Q-Former 的冻结消除了在海量图文数据上进行大量预训练的需求。从海量图文数据预训练的冻结 Q-Former 也有利于在图像-区域-文本数据上的预训练。我们将我们的框架命名为 RegionBLIP。我们在图像-区域-文本、点云-文本和点云-区域-文本数据上预训练 RegionBLIP。实验结果验证了 \Ours{} 能够保留 BILP-2 的图像理解能力,并进一步获得对新引入的点云模态及区域物体的理解。数据、代码和预训练模型将在 https://github.com/mightyzau/RegionBLIP 提供。
引用
@article{arxiv.2308.02299,
title = {RegionBLIP: A Unified Multi-modal Pre-training Framework for Holistic and Regional Comprehension},
author = {Qiang Zhou and Chaohui Yu and Shaofeng Zhang and Sitong Wu and Zhibing Wang and Fan Wang},
journal= {arXiv preprint arXiv:2308.02299},
year = {2023}
}