基于智能体交互学习的拼图任务以提升视觉感知与推理能力
人工智能
2026-02-12 v3 计算与语言
摘要
虽然当前大型视觉-语言模型 (VLM) 在多模态理解和推理方面取得了进展,但其根本的感知和推理能力仍有限。具体而言,即使在简单的拼图任务上,现有 VLM 也接近随机运行,揭示了感知和推理能力的缺陷。虽然高质量的视觉-语言数据可以增强这些能力,但其稀缺和有限的可扩展性施加了显著约束。为此,我们提出 AGILE,即基于智能体交互学习的拼图学习框架,用于提升视觉感知与推理能力。AGILE 将拼图解决建模为交互过程,使模型能够逐步与环境交互。在每一步,模型根据当前状态生成可执行代码以执行动作,而环境则提供细粒度的视觉反馈以指导任务完成。通过这一观察与交互的迭代循环,模型通过探索和反馈逐步提升其感知和推理能力。实验结果表明,AGILE 不仅在复杂程度不同的拼图任务上实现了显著提升(例如在 2×2 设置下准确率从 9.5% 提升至 82.8%),还在 9 项通用视觉任务中表现出强大的泛化能力,平均提升 3.1%。这些结果表明在感知和推理能力方面实现了显著增强。这一工作为推进多模态模型的推理与泛化提供了新途径,并提供了一种高效、可扩展的解决方案以缓解视觉-语言多模态强化学习数据的稀缺问题。代码和数据集已公开于 https://github.com/yuzeng0-0/AGILE。
引用
@article{arxiv.2510.01304,
title = {Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models},
author = {Yu Zeng and Wenxuan Huang and Shiting Huang and Xikun Bao and Yukun Qi and Yiming Zhao and Qiuchen Wang and Lin Chen and Zehui Chen and Huaian Chen and Wanli Ouyang and Feng Zhao},
journal= {arXiv preprint arXiv:2510.01304},
year = {2026}
}