中文

Chain-of-Sketch:实现全局视觉推理

机器学习 2025-06-27 v2 计算机视觉与模式识别

摘要

现代视觉模型在局部特征提供目标关键信息的基准测试中取得了显著成功。如今,人们对处理需要更多全局推理的任务越来越感兴趣,在这些任务中局部特征不提供重要信息。Minsky和Papert在1969年通过他们的连通性研究提出了此类任务,揭示了感知机模型的局限性。在本文中,我们引入了一个扩展的全局视觉数据集集合,涉及图、字符串、迷宫和图像网格。我们表明,大型视觉模型仍然难以有效学习这些任务。同样,最先进的多模态大语言模型在这些数据集上表现不佳。我们通过“全局性程度”度量来解释这种学习低效性。为了缓解这一问题,我们提出了一种称为chain-of-sketch(CoS)的方法。类似于语言模型中使用的思维链和草稿板技术,CoS将原始任务分解为中间视觉步骤,以帮助学习复杂任务。此外,我们表明并非所有CoS策略都表现同样好。我们的关键见解是对CoS帧施加马尔可夫结构。这导致了“归纳式CoS”的引入,与非归纳式变体相比,它实现了更好的分布外泛化,并且即使在较小的模型上也表现良好。

关键词

引用

@article{arxiv.2410.08165,
  title  = {Chain-of-Sketch: Enabling Global Visual Reasoning},
  author = {Aryo Lotfi and Enrico Fini and Samy Bengio and Moin Nabi and Emmanuel Abbe},
  journal= {arXiv preprint arXiv:2410.08165},
  year   = {2025}
}

备注

additional experiments added, title changed from "Visual Scratchpads: Enabling Global Reasoning in Vision" to "Chain-of-Sketch: Enabling Global Visual Reasoning"