VG-CoT:通过基于局部区域的链式思考实现可信视觉推理
计算机视觉与模式识别
2026-04-24 v1 人工智能
摘要
大型视觉语言模型(LLM)的发展需要精确的局部区域基于推理,使模型的逻辑能忠实地锚定在实际视觉证据上。然而,现有数据集因大量人工标注和缺乏多步骤推理与相应图像区域之间的显式对齐,在可扩展性方面受限,这限制了模型可信度评估。为此,我们提出视觉锚定链式思考(VG-CoT)数据集,通过完全自动化的三阶段管道显式地将每个推理步骤链接到图像中的真实视觉证据。该管道首先使用最先进的检测和 OCR 模型提取对象和文本级视觉证据,然后生成逐步基于锚定的推理,并通过基于理由的开放集检测进行锚定优化。此外,我们引入一个全面评估 LVLMs 推理的新基准,涵盖三个互补维度:理由质量、答案准确性和推理-答案对齐。实验表明,代表性 LVLMs 包括 LLaVA-1.5 和 Qwen2-VL 在大多数评估指标上均实现了一致改进,证明 VG-CoT 有效增强了可信赖的、基于证据的推理,同时保持了可扩展且高效的 dataset 构建。该数据集和代码将在接受录取后公开发布以促进进一步研究。
引用
@article{arxiv.2604.21396,
title = {VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought},
author = {Byeonggeuk Lim and Kyeonghyun Kim and JungMin Yun and YoungBin Kim},
journal= {arXiv preprint arXiv:2604.21396},
year = {2026}
}
备注
Accepted to LREC 2026