如同专家般观察:面向开放集细粒度视觉理解的知识增强智能体
计算机视觉与模式识别
2026-03-05 v1
摘要
细粒度视觉理解正在从静态分类转向知识增强推理,模型不仅要识别,还要给出依据。现有方法受限于封闭类别划分和单标签预测,在开放集或情境依赖条件下会出现显著性能下降。我们提出了知识增强细粒度推理智能体(KFRA),构建统一框架,将细粒度感知转化为以证据为导向的推理。KFRA 通过三阶段闭环推理流程模拟专家分析:首先进行开放词汇检测和网络规模检索生成类别假设;随后通过从全局到局部的聚焦机制,将文本知识与视觉证据对齐,实现判别性区域定位;最后在大型多模态模型中整合所有多模态证据,进行可解释推理。不同于现有智能体将检索与推理视为独立过程的做法,KFRA 建立了检索- grounding 耦合,将检索到的知识转化为空间上可验证的证据。该设计实现了跨多样细粒度场景的事实性、可解释且任务无关的推理。为评估此能力,我们构建了 FGExpertBench 框架,用于衡量推理深度和跨任务泛化能力,涵盖六个知识维度。大量实验表明,KFRA 在推理准确率上持续超越独立的大型多模态模型和当前智能体框架,提升最高可达 19 百分点,实现了开放集细粒度视觉理解中的证据导向可解释性。
引用
@article{arxiv.2603.03762,
title = {Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding},
author = {Junhan Chen and Zilu Zhou and Yujun Tong and Dongliang Chang and Yitao Luo and Zhanyu Ma},
journal= {arXiv preprint arXiv:2603.03762},
year = {2026}
}