中文

Sherlock:视觉语言模型中的自我纠错推理

计算机视觉与模式识别 2025-10-24 v2 计算与语言 机器学习

摘要

推理视觉语言模型(VLM)在复杂的多模态任务上展现出了有前景的性能。然而,它们仍面临重大挑战:对推理错误高度敏感,需要大量标注数据或准确的验证器,且难以泛化到特定领域之外。为了解决这些局限性,我们探索将自我纠错作为增强推理 VLM 的策略。我们首先对推理 VLM 的自我纠错能力进行了深入分析,并识别了关键差距。基于我们的发现,我们引入了 Sherlock,一个自我纠错与自我改进训练框架。Sherlock 引入了轨迹级别的自我纠错目标、基于视觉扰动的偏好数据构建方法,以及用于偏好调优的动态 β\beta。一旦模型仅使用 20k 随机采样的标注数据获得了自我纠错能力,它就能在没有外部监督的情况下持续自我改进。基于 Llama3.2-Vision-11B 模型,Sherlock 在八个基准测试中取得了显著成果,在直接生成下达到 64.1 的平均准确率,在自我纠错后达到 65.4。它在使用不到 20% 标注数据的情况下,优于 LLaVA-CoT(63.2)、Mulberry(63.9)和 LlamaV-o1(63.4)。

关键词

引用

@article{arxiv.2505.22651,
  title  = {Sherlock: Self-Correcting Reasoning in Vision-Language Models},
  author = {Yi Ding and Ruqi Zhang},
  journal= {arXiv preprint arXiv:2505.22651},
  year   = {2025}
}

备注

Published at NeurIPS 2025, 27 pages