知识型大型多模态模型的像素级 grounding 检索
计算机视觉与模式识别
2026-01-28 v1 人工智能
摘要
视觉问答(VQA)通常需要将细粒度感知与输入图像之外的事实知识相结合。先前的多模态检索增强生成(MM-RAG)系统在事实 grounding 上有所改进,但缺乏内部策略以决定何时以及如何检索。我们提出了 PixSearch,是首个统一区域级感知与检索增强推理的分段大型多模态模型(LMM)。在编码过程中,PixSearch 发射 <search> 标记以触发检索,选择查询模态(文本、图像或区域),并生成像素级掩码,这些掩码直接作为视觉查询,消除对模块化管道(检测器、分割器、描述符等)的依赖。一种两阶段监督微调方案配合搜索交叉监督教导检索时机和查询选择,同时保持分割能力。在以 egocentric 和 entity-centric VQA 数据集上测试时,PixSearch 在事实一致性和泛化能力方面显著提升,相较于基于整个图像检索的 CRAG-MM 准确率提升 19.7%,同时在各种 VQA 和文本-only QA 任务中保持有竞争力的推理性能。
引用
@article{arxiv.2601.19060,
title = {Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models},
author = {Jeonghwan Kim and Renjie Tao and Sanat Sharma and Jiaqi Wang and Kai Sun and Zhaojiang Lin and Seungwhan Moon and Lambert Mathias and Anuj Kumar and Heng Ji and Xin Luna Dong},
journal= {arXiv preprint arXiv:2601.19060},
year = {2026}
}
备注
Preprint