利用图案诱导打破视觉规划中的感知瓶颈
统计方法学
2026-05-26 v2
摘要
从原始视觉输入进行规划是当前视觉语言模型(VLM)面临的重大挑战,当输入复杂度超出其单步感知能力时便会受限。受到Thinking with Images(TWI)近期进展的启发,一个合理的解决方案是通过迭代获取和整合局部视觉证据,将感知过程分解为更简单的步骤。然而,尽管当前VLM在通用TWI能力方面已训练良好,但其在规划领域的感知瓶颈仍然存在。为应对这一挑战,我们将TWI形式化为逐步构建和反思准确内部世界模型的工具。我们发现,所得训练无关的规划策略使VLM能够解决远超其初始能力的任务,代价是过多的TWI操作会显著增加计算开销。为进一步提高效率,我们提出模式推断(Pattern Inference),这是一种新的TWI策略,使VLM能够主动识别新任务中已知的视觉模式并直接推断局部世界模型结构。为获取这些模式,我们提出模式诱导(Pattern Induction),这是一种将视觉模式视为复合且可重用的专家的在线归纳学习策略,这些专家可从经验中自主发现和优化。在FrozenLake、Crafter和CubeBench等领域的实验评估显示,我们的方法在准确性和效率之间取得了令人满意的平衡。
引用
@article{arxiv.2605.16846,
title = {Polynomial Maximization Method with Fractional Polynomial Basis: A Frequentist Bridge to Bayesian Fractional Polynomials},
author = {Serhii Zabolotnii},
journal= {arXiv preprint arXiv:2605.16846},
year = {2026}
}
备注
47 pages, 2 figures, 6 tables