中文

VISCO:面向视觉推理中自我改进的细粒度批判与纠错基准测试

计算机视觉与模式识别 2025-03-19 v2 人工智能 计算与语言

摘要

大型视觉-语言模型(LVLMs)批判和纠正自身推理的能力是其实现自我改进的关键基石。然而,目前仍缺乏对LVLMs此类能力的系统分析。我们提出了VISCO,这是首个广泛分析LVLMs细粒度批判与纠错能力的基准测试。与现有使用单一标量值来批判整个推理的工作[4]相比,VISCO具有密集且细粒度的批判,要求LVLMs评估思维链中每一步的正确性,并提供自然语言解释来支持其判断。对24个LVLMs的广泛评估表明,人工编写的批判显著提升了纠正后的性能,展示了自我改进策略的潜力。然而,模型生成的批判帮助较小,有时甚至对性能有害,这表明批判是关键瓶颈。我们识别出批判失败的三种常见模式:无法批判视觉感知、不愿“说不”以及夸大的错误传播假设。为解决这些问题,我们提出了一种有效的回顾策略,该策略重新审视图像以验证初始推理中的每一条信息。LookBack显著提升了批判和纠错性能,最高可达13.5%。

关键词

引用

@article{arxiv.2412.02172,
  title  = {VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning},
  author = {Xueqing Wu and Yuheng Ding and Bingxuan Li and Pan Lu and Da Yin and Kai-Wei Chang and Nanyun Peng},
  journal= {arXiv preprint arXiv:2412.02172},
  year   = {2025}
}

备注

CVPR 2025. https://visco-benchmark.github.io/