中文

Thyme: 超越图像的思考

计算机视觉与模式识别 2025-08-18 v1

摘要

在OpenAI提出「通过图像思考」概念之后,近期研究致力于激发视觉信息在推理过程中的使用,以增强模型在感知和推理任务中的表现。然而,据我们所知,目前尚无开源工作提供与专有模型(O3)同等丰富的功能集,后者能够执行多样化的图像操作并通过代码同时增强逻辑推理能力。在本文中,我们在此方向上进行了初步尝试,提出了Thyme(Think Beyond Images),一种新范式,使多模态大语言模型(MLLM)能够通过自主生成和执行多样化的图像处理与计算操作来超越现有的「通过图像思考」方法。该方法不仅促进了丰富的即时图像操作(如裁剪、旋转、对比度增强),还允许进行数学计算,同时在决定何时以及如何应用这些操作时保持高度自主性。我们通过两阶段训练策略激活该能力:首先在50万样本的精选数据集上进行SFT以教授代码生成,随后通过RL阶段优化决策。对于RL阶段,我们手动收集并设计了高分辨率问答对以增加学习难度,并提出了GRPO-ATS(带自适应温度采样的组相对策略优化),该算法对文本和代码生成应用不同的温度以平衡推理探索与代码执行精度。我们进行了广泛的实验分析和消融研究。在近20个基准上的综合评估表明,Thyme在具有挑战性的高分辨率感知和复杂推理任务上带来了显著且一致的性能提升。

关键词

引用

@article{arxiv.2508.11630,
  title  = {Thyme: Think Beyond Images},
  author = {Yi-Fan Zhang and Xingyu Lu and Shukang Yin and Chaoyou Fu and Wei Chen and Xiao Hu and Bin Wen and Kaiyu Jiang and Changyi Liu and Tianke Zhang and Haonan Fan and Kaibing Chen and Jiankang Chen and Haojie Ding and Kaiyu Tang and Zhang Zhang and Liang Wang and Fan Yang and Tingting Gao and Guorui Zhou},
  journal= {arXiv preprint arXiv:2508.11630},
  year   = {2025}
}

备注

Project page: https://thyme-vl.github.io/