GPT4RoI:面向感兴趣区域的大语言模型指令微调
计算机视觉与模式识别
2025-06-13 v5
摘要
在图像-文本对上视觉指令微调大语言模型(LLM)已获得通用视觉-语言能力。然而,区域-文本对的缺乏限制了其向细粒度多模态理解的发展。本文提出空间指令微调,在指令中引入对感兴趣区域(RoI)的引用。在送入 LLM 之前,该引用被 RoI 特征替换,并与语言嵌入交错排列为序列。我们的模型 GPT4RoI 在 7 个区域-文本对数据集上训练,相较以往图像级模型带来了前所未有的交互与对话体验。(1)超越语言的交互:用户可通过语言和绘制边界框与我们的模型交互,灵活调整指代粒度。(2)多样的多模态能力:GPT4RoI 可挖掘每个 RoI 内的多种属性信息,如颜色、形状、材质、动作等。此外,它可基于常识对多个 RoI 进行推理。在视觉常识推理(VCR)数据集上,GPT4RoI 取得了 81.6% 的显著准确率,大幅超越所有现有模型(第二名 75.6%),并几乎达到 85.0% 的人类水平性能。代码与模型见 https://github.com/jshilong/GPT4RoI。
引用
@article{arxiv.2307.03601,
title = {GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest},
author = {Shilong Zhang and Peize Sun and Shoufa Chen and Min Xiao and Wenqi Shao and Wenwei Zhang and Yu Liu and Kai Chen and Ping Luo},
journal= {arXiv preprint arXiv:2307.03601},
year = {2025}
}
备注
ECCV2024-Workshop, Camera-ready