中文

面向手术程序的内镜理解通用基础模型

计算机视觉与模式识别 2026-02-17 v1

摘要

在 minimally invasive 手术中,临床决策依赖于实时视觉解释,但手术中的感知在不同外科医生和程序之间存在显著差异。这种差异限制了一致的评估、培训以及可靠人工智能系统的开发,因为大多数手术AI模型设计用于狭窄定义的任务,且无法在程序或机构之间普遍化。本文介绍ZEN,一个面向内镜手术视频理解的通用基础模型,基于超过400万帧(来自21多个程序)的自监督多教师蒸馏框架进行训练。我们精选了大型且多样化的数据集,并在统一的基准测试中系统评估了多种表征学习策略。ZEN在20个下游任务以及全参数微调、冻结主干、few-shot和zero-shot设置下均一致优于现有的手术基础模型,显示出稳健的跨程序泛化。这些结果表明通往手术场景理解统一表征的进一步一步,并支持未来在内镜辅助和手术训练评估中的应用。

关键词

引用

@article{arxiv.2602.13633,
  title  = {A generalizable foundation model for intraoperative understanding across surgical procedures},
  author = {Kanggil Park and Yongjun Jeon and Soyoung Lim and Seonmin Park and Jongmin Shin and Jung Yong Kim and Sehyeon An and Jinsoo Rhu and Jongman Kim and Gyu-Seong Choi and Namkee Oh and Kyu-Hwan Jung},
  journal= {arXiv preprint arXiv:2602.13633},
  year   = {2026}
}