中文

一种用于从视频中时空映射手术的视觉-语言模型与平台

计算机视觉与模式识别 2026-03-25 v1 机器人学

摘要

手术映射是发展操作指南和实现自主机器人手术的基本任务。近期的人工智能进展在从视频中映射外科医生的行为方面显示出前景,但当前的模型范围有限,仅能在单一程序中捕获有限的行为组件,且提供有限的可转化价值,因为它们对从业外科医生而言不可得。本文中,我们引入 Halsted,一个在 Halsted Surgical Atlas(HSA) 上训练的视觉-语言模型,HSA 是一个通过迭代自标记框架培育的,涵盖超过 65 万个视频的综合性标注视频库,涵盖八个手术专业。为便于基准测试,我们公开发布了 HSA-27k,HSA 的一个子集。Halsted 在映射手术活动方面超越了以往的最先进模型,同时提供了更广泛的覆盖范围和更高的计算效率。为弥合长期的手术 AI 可转化性差距,我们开发了 Halsted Web 平台(https://halstedhealth.ai/),为世界各地的外科医生提供以前不可得的在几分钟内自动映射自己程序的能力。通过标准化非结构化手术视频数据并使这些能力直接可访问我们的工作使手术 AI 接近临床部署,为实现自主机器人手术铺平了道路。

关键词

引用

@article{arxiv.2603.22583,
  title  = {A vision-language model and platform for temporally mapping surgery from video},
  author = {Dani Kiyasseh},
  journal= {arXiv preprint arXiv:2603.22583},
  year   = {2026}
}