AdaTooler-V:图像和视频的自适应工具使用
计算机视觉与模式识别
2026-04-29 v3
摘要
近期进展表明,多模态大语言模型(MLLM)从受控的多模态交叉链式思考(CoT)中受益于视觉工具交互。然而,现有开源模型常表现出盲目工具使用模式,即使工具并非必要时仍会调用视觉工具,这显著增加推理开销并降低模型性能。为此,我们提出 AdaTooler-V,一种进行自适应工具使用的 MLLM,通过确定视觉问题是否真正需要工具来实现自适应。首先,我们引入 AT-GRPO,一种强化学习算法,根据每个样本的 Tool Benefit Score 自适应调整奖励比例,鼓励模型仅在工具提供真实性改进时调用工具。此外,我们构建了两个数据集以支持训练:AdaTooler-V-CoT-100k 用于 SFT 冷启动,AdaTooler-V-300k 用于 RL 训练。实验覆盖十二个基准,显示 AdaTooler-V 具备强大的推理能力,在各种视觉推理任务中超越现有方法。值得注意的是,AdaTooler-V-7B 在高分辨率基准 V* 上实现了 89.8% 的准确率,超越了商业专有模型 GPT-4o 和 Gemini 1.5 Pro。所有代码、模型和数据均已公开。
引用
@article{arxiv.2512.16918,
title = {AdaTooler-V: Adaptive Tool-Use for Images and Videos},
author = {Chaoyang Wang and Kaituo Feng and Dongyang Chen and Zhongyu Wang and Zhixun Li and Sicheng Gao and Meng Meng and Xu Zhou and Manyuan Zhang and Yuzhang Shang and Xiangyu Yue},
journal= {arXiv preprint arXiv:2512.16918},
year = {2026}
}
备注
ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V