$\mathsf{CSMAE~}$:基于掩码自编码器(MAE)的猫瞎手术预训练方法
计算机视觉与模式识别
2025-02-14 v1
摘要
对手术视频的自动化分析对于提高手术培训、工作流程优化和术后评估至关重要。我们引入 CSMAE(Cataract Surgical Masked Autoencoder),这是一种针对猫瞎手术视频分析开发的基于掩码自编码器(MAE)的预训练方法。与随机选择标记进行掩码处理不同,我们根据标记的时空重要性选择掩码。我们创建了一个大型猫瞎手术视频数据集,以提高模型的学习效率并扩大其在小数据场景下的鲁棒性。我们预训练的模型可以通过微调轻松适用于特定的下游任务,作为进一步分析的强大基础模型。通过在两个猫瞎手术视频数据集 D99 和 Cataract-101 上的下游步骤识别任务进行严格测试,我们的方法在当前基于 MAE 的自监督预训练和基于适配器的迁移学习方法上显著超越。这一进展不仅展示了 MAE-based 预训练在手术视频分析领域的潜力,也为未来研究设立了新的基准。
引用
@article{arxiv.2502.08822,
title = {$\mathsf{CSMAE~}$:~Cataract Surgical Masked Autoencoder (MAE) based Pre-training},
author = {Nisarg A. Shah and Wele Gedara Chaminda Bandara and Shameema Skider and S. Swaroop Vedula and Vishal M. Patel},
journal= {arXiv preprint arXiv:2502.08822},
year = {2025}
}
备注
5 pages, Accepted to IEEE International Symposium on Biomedical Imaging (ISBI 2025)