从易到难:通过数据合成构建即插即用视觉推理器
计算与语言
2024-10-14 v2 人工智能
摘要
我们探索了视觉语言模型(VLM)中的多步推理问题。该问题具有挑战性,因为几乎没有包含多步视觉和语言处理的推理数据。为克服这一挑战,我们首先引入了最小化到最大化的视觉推理范式,该范式交叉式地分解问题以生成子问题,并调用外部工具来解决子问题。基于该范式,我们进一步提出了一种 novel 数据合成方法,能够以自底向上的方式自动为图像创建问题和多步推理路径。我们的 approach 将复杂的合成任务划分为几个简单的子任务,几乎完全依赖于开源模型来完成子任务。因此,整个合成过程是可复现且高性价比的,合成数据质量有保障。通过该 approach,我们构建了 5 万个视觉推理示例。随后,我们通过监督式微调开发了一个视觉推理器,能够以即插即用的方式普遍提升广泛现有 VLM 的推理能力。大量实验表明,该视觉推理器在四个 VQA 基准测试中均能稳定显著地提升四个 VLM 的性能。我们的代码和数据集已提供给公众。
引用
@article{arxiv.2406.19934,
title = {From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis},
author = {Chuanqi Cheng and Jian Guan and Wei Wu and Rui Yan},
journal= {arXiv preprint arXiv:2406.19934},
year = {2024}
}
备注
Accepted by EMNLP 2024