通过图像激励工具增强推理用于医学图像分析
人工智能
2025-12-17 v1 计算机视觉与模式识别
摘要
最近的基于推理的医学多模态大语言模型在生成逐步文本推理链方面取得了进展。然而,它们仍在需要动态迭代聚焦于细粒度视觉区域以实现精确定位和诊断的复杂任务中受限。我们引入Ophiuchus,一个功能强大的工具增强框架,为 MLLM 提供 (i) 判断是否需要额外视觉证据、(ii) 确定在医学图像中应探查和定位的区域、以及 (iii) 将相关子图像内容无缝编织进交错的多模态思考链。与受限于专用工具性能上限的先前方法不同,Ophiuchus 将模型内在的定位和感知能力与外部工具相结合,从而促进更高层次的推理。本方法的核心是三个阶段的训练策略:使用工具集成推理数据进行 cold-start 训练以实现基本工具选择和适应,以检查关键区域;进行自反思微调以强化反思性推理并鼓励重新审视工具输出;以及通过智能体工具强化学习直接优化任务特定奖励,模拟专家式的诊断行为。大量实验表明,Ophiuchus 在包括 VQA、检测和基于推理的分割等多样化医学基准上 consistently 超过了包括闭源和开源 SOTA 方法。我们的ethods 揭示了一条通向能够通过工具集成推理真正“以图像思考”的医疗 AI 代理的道路。数据集、代码和训练好的模型将公开发布。
引用
@article{arxiv.2512.14157,
title = {Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis},
author = {Yankai Jiang and Yujie Zhang and Peng Zhang and Yichen Li and Jintai Chen and Xiaoming Shi and Shihui Zhen},
journal= {arXiv preprint arXiv:2512.14157},
year = {2025}
}