MedScope:通过粗到细工具调用激励临床推理中的“以视频思考”
计算机视觉与模式识别
2026-02-17 v1 人工智能
摘要
长篇临床视频是视觉证据驱动决策的核心材料,正在变得越来越重要,尤其在外科机器人等应用场景中。然而,当前多模态大语言模型(MLLM)通常采用被动抽样或弱关联检查处理视频,限制了其在时序精准定位、验证与论证预测方面的能力。为弥合这一差距,本文提出 MedScope,一种进行粗到细证据搜寻的临床视频推理模型。通过在中间推理步骤中交替进行有针对性的工具调用与验证性观察,MedScope 能生成更准确可信的预测,并以明确的时间局部化视觉证据为依据。为解决缺乏高保真监督的问题,我们构建 ClinVideoSuite——一个以证据为中心、粒度细致的临床视频数据集。随后,我们采用 Grounding-Aware Group Relative Policy Optimization(GA-GRPO)进行模型优化,该方法直接以 grounding 对齐奖励和证据加权优势强化工具使用。在完整及细粒度视频理解基准测试中,MedScope 在 both in-domain 与 out-of-domain 评估中实现了状态的最佳性能。我们的工作阐明了一条通向具备真正“以视频思考”能力的医疗 AI 代理的路径。我们将公开代码、模型与数据。
引用
@article{arxiv.2602.13332,
title = {MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling},
author = {Wenjie Li and Yujie Zhang and Haoran Sun and Xingqi He and Hongcheng Gao and Chenglong Ma and Ming Hu and Guankun Wang and Shiyi Yao and Renhao Yang and Hongliang Ren and Lei Wang and Junjun He and Yankai Jiang},
journal= {arXiv preprint arXiv:2602.13332},
year = {2026}
}