视觉思维混合:探索面向通用视觉推理的上下文自适应推理模式选择
人工智能
2026-05-15 v2 计算机视觉与模式识别
摘要
当前的视觉推理方法主要侧重于探索特定的推理模式。尽管在特定领域可以取得改进,但它们难以发展出通用的推理能力。受此启发,我们提出了一种新颖的自适应推理范式——视觉思维混合(MoVT),它在单一模型中统一了不同的推理模式,并引导其根据上下文选择合适的模式。为实现这一目标,我们引入了 AdaVaR,一个两阶段的自适应视觉推理学习框架:在监督冷启动阶段统一并学习不同的模式,然后通过一个精心设计的 AdaGRPO 算法的强化学习过程来诱导模式选择能力。大量实验表明,AdaVaR 能有效引导模型学习和区分多种模式,并进行上下文自适应模式选择,在多种场景下均取得了一致的改进,突显了 MoVT 作为构建通用视觉推理模型的有效解决方案。
引用
@article{arxiv.2509.22746,
title = {Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning},
author = {Zejun Li and Yingxiu Zhao and Jiwen Zhang and Siyuan Wang and Yang Yao and Runzhou Zhao and Jun Song and Bo Zheng and Zhongyu Wei},
journal= {arXiv preprint arXiv:2509.22746},
year = {2026}
}
备注
27 pages, 11 figures, 5 tables, accepted by ICLR 2026