LEMON:面向手术场景感知的大型内窥镜单目数据集与基础模型
计算机视觉与模式识别
2026-03-24 v4
摘要
专注于手术过程的传统开放获取数据集通常受限于其较小的规模,一般包含少于 100 个视频且总时长不足 30 小时,这导致模型泛化能力较差。为解决这一数据局限性,我们使用一种新颖的聚合流水线从在线来源收集高分辨率视频,编译了一个名为 LEMON 的新数据集。LEMON 拥有超过 4K 个手术视频、总计 938 小时(8500 万帧)的高质量影像,涵盖多种手术类型,在规模和范围上超越了现有资源,并包含两个新颖的下游任务。为展示这一多样化数据集的有效性,我们引入了 LemonFM,这是一个在 LEMON 上使用新颖的自监督增强知识蒸馏方法预训练的基础模型。LemonFM 在四个下游任务和六个数据集上均优于现有的手术基础模型,在手术阶段识别(在 AutoLaparo、M2CAI16 和 Cholec80 上 Jaccard 分别提升 +9.5pp、+9.4pp 和 +8.4pp)、手术动作识别(在 CholecT50 上 mAP 提升 +4.4pp)、手术器械存在检测(在 Cholec80 和 GraSP 上 mAP 分别提升 +5.3pp 和 +10.2pp)以及手术语义分割(在 CholecSeg8k 上 mDice 提升 +10.3pp)方面均取得了显著提升。LEMON 和 LemonFM 将作为研究界和工业界的基础资源,加速自主机器人手术系统的发展进程,并最终为全球更安全、更普及的医疗服务做出贡献。数据集、代码和模型已公开于 https://github.com/visurg-ai/LEMON。
引用
@article{arxiv.2503.19740,
title = {LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings},
author = {Chengan Che and Chao Wang and Tom Vercauteren and Sophia Tsoka and Luis C. Garcia-Peraza-Herrera},
journal= {arXiv preprint arXiv:2503.19740},
year = {2026}
}
备注
Accepted at CVPR2026 main conference