视觉抽象推理的数据合成与后训练
计算机视觉与模式识别
2025-04-03 v1 人工智能
计算与语言
摘要
本文是首次尝试解决大型视觉-语言模型(VLMs)的抽象视觉推理(AVR)问题的工作。我们使通用的7B规模LLaVA-NeXT模型能够感知并推理特定的AVR问题,显著超过开源的(如Qwen-2-VL-72B)和封闭源的强大VLMs(如GPT-4o)。这是一个重大突破,因为几乎所有的现有VLMs在代表性的AVR基准测试上都失败或几乎表现为随机。我们的关键成功在于创新的数据合成和后训练过程,旨在完全缓解任务难度,逐步引导模型学习。我们的7B模型也在不牺牲常规多模态理解能力的前提下表现良好。我们希望本文能为该领域的早期工作,激发进一步的研究在抽象视觉推理。
关键词
引用
@article{arxiv.2504.01324,
title = {On Data Synthesis and Post-training for Visual Abstract Reasoning},
author = {Ke Zhu and Yu Wang and Jiangjiang Liu and Qunyi Xie and Shanshan Liu and Gang Zhang},
journal= {arXiv preprint arXiv:2504.01324},
year = {2025}
}