具有细粒度视觉感知的多模态指令微调大型语言模型
计算机视觉与模式识别
2024-03-26 v2
摘要
多模态大型语言模型 (MLLMs) 利用大型语言模型作为多样化视觉 - 语言任务的认知框架。最近的努力致力于赋予 MLLMs 视觉感知和定位能力。然而,在提供细粒度像素级感知以及将交互扩展到特定文本输入之外方面仍存在差距。在本工作中,我们提出了 {\bf{AnyRef}},一种通用的 MLLM 模型,能够从多模态参考(如文本、框、图像或音频)生成逐像素的对象感知和自然语言描述。这一创新使用户能够超越文本和区域提示,更灵活地与模型交互,而无需特定模态的设计。通过我们提出的重聚焦机制,生成的定位输出被引导以更好地聚焦于参考对象,隐式地结合了额外的像素级监督。这一简单的修改利用了 LLM 推理过程中生成的注意力分数,消除了对额外计算的需求,同时在定位掩码和指代表达式方面表现出性能提升。仅使用公开可用的训练数据,我们的模型在多个基准测试中取得了最先进 (SOTA) 的结果,包括多样化模态的指代分割和区域级指代表达式生成。
引用
@article{arxiv.2403.02969,
title = {Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception},
author = {Junwen He and Yifan Wang and Lijun Wang and Huchuan Lu and Jun-Yan He and Jin-Peng Lan and Bin Luo and Xuansong Xie},
journal= {arXiv preprint arXiv:2403.02969},
year = {2024}
}
备注
CVPR 2024