Cataract-LMM:面向外科视频分析的大规模多源多任务基准数据集
计算机视觉与模式识别
2026-05-08 v3 人工智能
机器学习
摘要
计算机辅助外科手术研究需要大规模、深度标注的视频数据集,以捕捉临床和技术层面的变异性。现有白内障手术资源缺乏所需的多样性和标注深度,以训练具有普适性的深度学习模型。为此,我们提出了一个包含 3000 份全程 phacoemulsification 白内障手术视频的数据集,这些视频来自来自两家手术中心、来自不同水平专业医生的手术记录。该数据集提供四层标注:时间性手术阶段、器械和解剖结构的实例分割、器械-组织相互作用跟踪,以及基于ICO-OSCAR 和 GRASIS 适应的 competency rubrics 量化技能评分。我们通过在四项任务上进行基准测试来展示数据集的技术实用性:工作流程识别、场景分割、器械-组织相互作用跟踪和自动化技能评估。此外,我们建立了一个针对阶段识别和实例分割的数据适应基线,方法是在一家手术中心上训练,在保留下来的中心上评估。最终,这些多源获取、多层标注和配对技能-运动标签促进了开发针对手术工作流程分析、场景理解和基于 competency 的培训研究的通用性多任务模型的开发。
引用
@article{arxiv.2510.16371,
title = {Cataract-LMM Large-Scale Multi-Source Multi-Task Benchmark for Deep Learning in Surgical Video Analysis},
author = {Mohammad Javad Ahmadi and Iman Gandomi and Parisa Abdi and Seyed-Farzad Mohammadi and Amirhossein Taslimi and Mehdi Khodaparast and Hassan Hashemi and Mahdi Tavakoli and Hamid D. Taghirad},
journal= {arXiv preprint arXiv:2510.16371},
year = {2026}
}
备注
28 pages, 14 figures, 15 tables. Data descriptor for the Cataract-LMM benchmark dataset. Source code and dataset are available