CoSPlan:基于场景图增量更新的纠错顺序规划
计算机视觉与模式识别
2025-12-30 v2
摘要
大型视觉语言模型(Large-scale Vision-Language Models, VLMs)在复杂推理方面表现出色,但在视觉顺序规划领域仍鲜有探索,即执行多步骤动作以达成目标。此外,实际的顺序规划常涉及非最优(错误)步骤,挑战 VLMs 检测并纠正此类步骤。我们提出纠错顺序规划基准测试(Corrective Sequential Planning Benchmark, CoSPlan),以评估 VLMs 在错误且基于视觉的顺序规划任务中的表现,这些任务涵盖 4 个领域:迷宫导航、块重排、图像重建和物体重组。CoSPlan 评估两个关键能力:错误检测(识别非最优动作)和步骤完成(纠正并完成动作序列以达成目标)。尽管使用了链式思维(Chain-of-Thought)和场景图(Scene Graphs)等最先进的推理技术,VLMs(如 Intern-VLM 和 Qwen2)在 CoSPlan 上仍表现不佳,未能利用上下文线索达成目标。为此,我们提出一种新颖的无训练方法——场景图增量更新(Scene Graph Incremental updates, SGI),其在初始状态和目标状态之间引入中间推理步骤。SGI 有助于 VLMs 推理序列,平均性能提升 5.2%。除了增强纠错顺序规划中的可靠性,SGI 还可推广到传统规划任务,如 Plan-Bench 和 VQA。项目页面:https://shroglck.github.io/cos_plan/
引用
@article{arxiv.2512.10342,
title = {CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates},
author = {Shresth Grover and Priyank Pathak and Akash Kumar and Vibhav Vineet and Yogesh S Rawat},
journal= {arXiv preprint arXiv:2512.10342},
year = {2025}
}