Panther:以指令引导的视觉提示点亮多模态 LLM 的视觉
计算机视觉与模式识别
2024-11-25 v2
摘要
多模态大语言模型 (MLLMs) 正在迅速缩小与人类视觉感知能力的差距,但在关注细微图像细节或精确定位小物体等方面仍显落后。解决这些问题的常见方案包括部署多个视觉编码器或直接在原始高分辨率图像上进行操作。很少有研究关注利用文本指令来改善视觉表示,导致在一些以视觉为中心的任务中失去焦点,我们将这一现象称为“弱视”。在本工作中,我们引入了 Panther,一种像黑豹般敏捷、紧密遵循用户指令并精确定位感兴趣目标的 MLLM。具体而言,Panther 包含三个组成部分:Panther-VE、Panther-Bridge 和 Panther-Decoder。Panther-VE 在视觉编码器的早期阶段集成了用户指令信息,从而提取最相关和最有用的视觉表示。Panther-Bridge 模块具备强大的过滤能力,可显著减少冗余视觉信息,从而大幅节省训练成本。Panther-Decoder 具有通用性,可无差别地应用于任何仅解码器架构的 LLM。实验结果,特别是在以视觉为中心的基准测试上,证明了 Panther 的有效性。
引用
@article{arxiv.2411.13909,
title = {Panther: Illuminate the Sight of Multimodal LLMs with Instruction-Guided Visual Prompts},
author = {Honglin Li and Yuting Gao and Chenglu Zhu and Jingdong Chen and Ming Yang and Lin Yang},
journal= {arXiv preprint arXiv:2411.13909},
year = {2024}
}