标记集提示释放 GPT-4V 的卓越视觉定位能力
计算机视觉与模式识别
2023-11-07 v2 人工智能
计算与语言
人机交互
摘要
我们提出标记集(Set-of-Mark,SoM)这一新型视觉提示方法,以释放如 GPT-4V 等大型多模态模型(LMMs)的视觉定位能力。如图 1(右)所示,我们采用现成的交互式分割模型(如 SEEM/SAM)将图像划分为不同粒度的区域,并用一组标记(如字母数字、掩码、框)覆盖这些区域。以标记图像作为输入,GPT-4V 能够回答需要视觉定位的问题。我们开展了全面的实证研究,在广泛的细粒度视觉与多模态任务上验证 SoM 的有效性。例如,我们的实验表明,在零样本设定下带 SoM 的 GPT-4V 在 RefCOCOg 上优于最先进的完全微调指代表达理解与时分割模型。SoM 提示的代码已公开于:https://github.com/microsoft/SoM。
引用
@article{arxiv.2310.11441,
title = {Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V},
author = {Jianwei Yang and Hao Zhang and Feng Li and Xueyan Zou and Chunyuan Li and Jianfeng Gao},
journal= {arXiv preprint arXiv:2310.11441},
year = {2023}
}