中文

SurgRAW:用于机器人手术视频分析的多智能体工作流与思维链推理

人工智能 2026-02-19 v2 机器人学

摘要

机器人辅助手术(RAS)是现代手术的核心,推动了对具有准确场景理解能力的智能系统的需求。大多数现有的手术AI方法依赖于孤立的、特定任务的模型,导致碎片化的流水线,解释性有限,且缺乏对RAS场景的统一理解。视觉语言模型(VLM)具有强大的零样本推理能力,但在幻觉、领域差距和弱任务依赖性建模方面存在困难。为解决RAS场景理解中统一数据的缺乏问题,我们引入了SurgCoTBench——第一个面向推理的RAS基准,涵盖14256个QA对,包含五个主要手术任务的帧级标注。基于SurgCoTBench,我们提出了SurgRAW,一个面向手术的临床对齐的思维链(CoT)驱动的智能体工作流,用于零样本多任务推理。SurgRAW采用分层推理工作流,其中编排器将手术场景理解划分为两个推理流,并指导专门智能体生成任务级推理,而更高层智能体捕获工作流依赖关系或进行临床级输出grounding。具体而言,我们提出了一种小组讨论机制,以确保任务特定智能体协同合作并利用任务依赖性。同样,我们结合了检索增强生成模块,为智能体丰富手术知识并缓解通用VLM中的领域差距。我们设计了基于手术领域的任务特定CoT提示,以确保临床对齐的推理、减少幻觉并增强解释性。大量实验表明,SurgRAW超越了主流VLM和智能体系统,并比监督模型高出14.61%的准确率。数据集和代码可在https://github.com/jinlab-imvr/SurgRAW.git获取。

关键词

引用

@article{arxiv.2503.10265,
  title  = {SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis},
  author = {Chang Han Low and Ziyue Wang and Tianyi Zhang and Zhu Zhuo and Zhitao Zeng and Evangelos B. Mazomenos and Yueming Jin},
  journal= {arXiv preprint arXiv:2503.10265},
  year   = {2026}
}