VISCO:面向视觉推理中自我改进的细粒度批判与纠错基准测试
计算机视觉与模式识别
2025-03-19 v2 人工智能
计算与语言
摘要
大型视觉-语言模型(LVLMs)批判和纠正自身推理的能力是其实现自我改进的关键基石。然而,目前仍缺乏对LVLMs此类能力的系统分析。我们提出了VISCO,这是首个广泛分析LVLMs细粒度批判与纠错能力的基准测试。与现有使用单一标量值来批判整个推理的工作[4]相比,VISCO具有密集且细粒度的批判,要求LVLMs评估思维链中每一步的正确性,并提供自然语言解释来支持其判断。对24个LVLMs的广泛评估表明,人工编写的批判显著提升了纠正后的性能,展示了自我改进策略的潜力。然而,模型生成的批判帮助较小,有时甚至对性能有害,这表明批判是关键瓶颈。我们识别出批判失败的三种常见模式:无法批判视觉感知、不愿“说不”以及夸大的错误传播假设。为解决这些问题,我们提出了一种有效的回顾策略,该策略重新审视图像以验证初始推理中的每一条信息。LookBack显著提升了批判和纠错性能,最高可达13.5%。
引用
@article{arxiv.2412.02172,
title = {VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning},
author = {Xueqing Wu and Yuheng Ding and Bingxuan Li and Pan Lu and Da Yin and Kai-Wei Chang and Nanyun Peng},
journal= {arXiv preprint arXiv:2412.02172},
year = {2025}
}
备注
CVPR 2025. https://visco-benchmark.github.io/