视觉-语言智能体:面向协作式上下文目标推理
计算机视觉与模式识别
2024-11-18 v1
摘要
多模态大语言模型 (MLLM) 在图像描述任务中表现出色,但在精确目标定位方面往往力不从心,而这却是可靠视觉理解的关键要素。相比之下,传统目标检测模型虽提供高定位精度,但因对目标间关系建模有限,常产生缺乏上下文连贯性的检测结果。为解决这一根本局限,我们提出了视觉-语言智能体 (Visual-Linguistic Agent, VLA),一种融合 MLLM 关系推理优势与传统目标检测器精确定位能力的协作框架。在 VLA 范式中,MLLM 作为核心语言智能体,与专门负责目标检测和分类的视觉智能体协同工作。语言智能体通过推理目标间的空间与上下文关系来评估和细化检测结果,而分类视觉智能体则提供纠正性反馈以提升分类准确性。这种协作方法使 VLA 显著增强了空间推理和目标定位能力,解决了多模态理解中的关键挑战。在 COCO 数据集上的大量评估显示,VLA 在多个检测模型上均取得了显著性能提升,凸显了其在准确且上下文连贯的目标检测领域树立新基准的潜力。
引用
@article{arxiv.2411.10252,
title = {Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning},
author = {Jingru Yang and Huan Yu and Yang Jingxin and Chentianye Xu and Yin Biao and Yu Sun and Shengfeng He},
journal= {arXiv preprint arXiv:2411.10252},
year = {2024}
}