驯服检索框架以人类方式读取图像,以增强多模态大语言模型的生成
计算机视觉与模式识别
2025-10-14 v1 人工智能
摘要
多模态大语言模型(MLLMs)在细粒度视觉问答任务中常常失败,因文本查询未被显式锚定到视觉参照物,导致对物体身份、位置和关系的幻觉。检索增强生成(RAG)缓解了部分错误,但在检索和增强层面均未与人类式处理方式一致。具体而言,传统RAG仅关注全局级图像信息,缺乏局部细节,限制了对细粒度相互作用的推理。为克服此限制,本文提出人类式检索增强生成框架(HuLiRAG),将多模态推理分解为“什么-哪里-重加权”级联过程。查询首先通过开放词汇检测锚定到候选参照物(what),随后利用SAM分割掩码实现空间解析以恢复细粒度精度(where),最后通过局部与全局对齐之间的权衡实现自适应优先级(reweight)。掩码引导的微调进一步将空间证据注入生成过程,将 grounding 从被动偏置转化为答案表述的显式约束。大量实验表明,这种人类式级联方法提升了 grounding 忠实度和事实一致性,同时降低了幻觉现象,推动了多模态问答向可靠推理的发展。
引用
@article{arxiv.2510.10426,
title = {Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs},
author = {Suyang Xi and Chenxi Yang and Hong Ding and Yiqing Ni and Catherine C. Liu and Yunhao Liu and Chengqi Zhang},
journal= {arXiv preprint arXiv:2510.10426},
year = {2025}
}
备注
12 pages, 5 figures