TIR-Bench:智能体式图像思考-图像推理的全面基准
计算机视觉与模式识别
2025-11-07 v2
摘要
视觉推理的前沿正向能够像 OpenAI o3 那样智能创建和操作工具以变形图像以解决问题的模型靠拢,这也被称为链式思维中的「思考-图像」。然而,现有的基准测试未能完全捕捉这种先进能力。即使是最常见的视觉搜索基准,仅测试了局限于定位和裁剪等基础操作,对更复杂、动态且依赖工具的推理提供了有限的洞察。我们引入 \textbf{TIR-Bench},用于评估智能体式图像思考-图像跨 13 种多样化任务的基准,每项任务都需要针对链式思维中图像处理和操作的 novel tool use。我们评估了 22 种多模态大语言模型 (MLLM),涵盖领先的开源模型与专有模型,以及具备显式工具使用增强的模型。结果表明,TIR-Bench 具有普遍的挑战性,强性能需要具备真正的图像思考-图像能力。最后,我们提出了一项试点研究,比较直接微调与智能体式微调。
引用
@article{arxiv.2511.01833,
title = {TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning},
author = {Ming Li and Jike Zhong and Shitian Zhao and Haoquan Zhang and Shaoheng Lin and Yuxiang Lai and Chen Wei and Konstantinos Psounis and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2511.01833},
year = {2025}
}
备注
Preprint