迈向视觉大语言模型中的交互式区域理解
计算机视觉与模式识别
2024-03-28 v1 计算与语言
摘要
近期的视觉-语言预训练(VLP)模型已展现出显著的进展。然而,这些模型严重依赖仅捕获图像粗略和全局信息的图文对,导致其区域理解能力受限。在本研究中,我们引入了 \textbf{RegionVLM},其具备显式的区域建模能力,允许它们理解用户指定的图像区域。为实现这一点,我们设计了一种简单而创新的架构,无需修改模型架构或目标函数。此外,我们利用了一个包含新颖信息源的数据集,即 Localized Narratives,该数据集在以往的 VLP 研究中被忽视。我们的实验表明,我们的单一通用模型不仅实现了交互式对话系统,而且在各种零样本区域理解任务上表现出卓越的性能,同时未损害其全局图像理解的能力。
引用
@article{arxiv.2403.18260,
title = {Toward Interactive Regional Understanding in Vision-Large Language Models},
author = {Jungbeom Lee and Sanghyuk Chun and Sangdoo Yun},
journal= {arXiv preprint arXiv:2403.18260},
year = {2024}
}
备注
NAACL 2024 Main Conference