HopChain:通用视觉语言推理的多跳数据合成
计算机视觉与模式识别
2026-03-20 v2 人工智能
计算与语言
摘要
视觉语言模型(VLM)在多模态能力方面表现出强大,但在细粒度视觉语言推理方面仍存在挑战。我们发现,长链式思维(CoT)推理暴露了多样的失败模式,包括感知、推理、知识和幻觉错误,这些错误在中间步骤中会相互叠加。然而,大多数用于强化学习可验证奖励(RLVR)的现有视觉语言数据并不涉及依赖视觉证据的复杂推理链,导致这些弱点 largely unexposed。因此,我们提出了HopChain,一个用于RLVR训练VLM多跳视觉语言推理数据合成的可扩展框架。每个合成的多跳查询形成一个逻辑上相互依赖的链,前序 hops 建立所需的实例、集合或条件,以支持后续 hops,而最终答案保持具体、明确的数字,适合可验证奖励。我们在Qwen3.5-35B-A3B和Qwen3.5-397B-A17B上采用两种RLVR设置进行训练:仅使用原始数据,以及原始数据加上HopChain的多跳数据,并在24个基准测试中进行比较,涵盖STEM和拼图、通用VQA、文本识别和文档理解、视频理解等。尽管这种多跳数据并非为特定基准测试合成,但在两个模型的24个基准测试中提高了20个,表明具有广泛且通用的提升。持续地,用半多跳或单跳变体替换完整链式查询,使五个代表性基准测试的平均得分从70.4降至66.7和64.3。值得注意的是,在超长CoT视觉语言推理中,多跳提升可超过50分。这些实验确立了HopChain作为提高通用视觉语言推理的有效、可扩展框架。
引用
@article{arxiv.2603.17024,
title = {HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning},
author = {Shenzhi Wang and Shixuan Liu and Jing Zhou and Chang Gao and Xiong-Hui Chen and Binghai Wang and An Yang and Shiji Song and Bowen Yu and Gao Huang and Junyang Lin},
journal= {arXiv preprint arXiv:2603.17024},
year = {2026}
}
备注
28 pages, 8 figures, 2 tables