CataractSAM-2:面向前段手术的领域适应模型与可扩展真实标注
计算机视觉与模式识别
2026-03-24 v1 人工智能
数据库
机器学习
机器人学
摘要
我们提出CataractSAM-2,这是Meta的Segment Anything Model 2的一个领域适应扩展,旨在实现对 cataract 眼科手术视频的高精度实时语义分割。该模型位于计算机视觉与医学机器人交汇的领域,使能够实现对机器人辅助和计算机导向手术系统至关重要的准确内手术感知。此外,为减轻手动标注的负担,我们引入一种交互式标注框架,将稀疏提示与视频基于掩码的传播相结合。该工具显著减少了标注时间,并促进了眼科前段手术高质量真实标注掩码的可扩展创建,加速了数据集开发。我们还展示了该模型对 glaucoma trabeculectomy 程序的强大零样本泛化能力,确认了其跨程序实用性及其更广泛手术应用的潜力。该训练好的模型和标注工具以开源形式发布,使CataractSAM-2成为扩充眼科前段手术数据集、推进医学机器人领域实时AI驱动解决方案以及手术视频理解的基础。
引用
@article{arxiv.2603.21566,
title = {CataractSAM-2: A Domain-Adapted Model for Anterior Segment Surgery Segmentation and Scalable Ground-Truth Annotation},
author = {Mohammad Eslami and Dhanvinkumar Ganeshkumar and Saber Kazeminasab and Michael G. Morley and Michael V. Boland and Michael M. Lin and John B. Miller and David S. Friedman and Nazlee Zebardast and Lucia Sobrin and Tobias Elze},
journal= {arXiv preprint arXiv:2603.21566},
year = {2026}
}