多模态模型会想象电子羊吗?
计算机视觉与模式识别
2026-05-12 v1 人工智能
机器学习
摘要
是的。我们发现,大型多模态模型在解决空间谜题时会发展出心理意象,并且在解决羊的谜题时确实会想象羊。我们微调了一个Qwen3.5视觉语言模型来解决十二种不同的视觉推理任务——包括七巧板、拼图、推箱子、3D心理旋转和 rush hour——这些任务需要理解几何、空间关系和动作的后果。通过监督模型从初始状态预测解决谜题的开放循环动作序列,我们表明模型在每个动作后的激活编码了关于中间状态的有意义的视觉信息。这一发现表明,在没有任何显式视觉监督的情况下,一个不完美的视觉世界模型开始作为学习选择正确动作的副产品而形成。基于这一观察,我们提出了两种锐化和使用模型形成的心理图像的方法。我们发现,在思维链中每步集成少至16个视觉标记,可将平均解决率从83%提高到89%,在拼图和3D心理旋转等推理密集型任务上尤其有显著提升。
引用
@article{arxiv.2605.09693,
title = {Do multimodal models imagine electric sheep?},
author = {Santhosh Kumar Ramakrishnan and Carl Vondrick and Raja Giryes and Philipp Krähenbühl and Vladlen Koltun},
journal= {arXiv preprint arXiv:2605.09693},
year = {2026}
}