SHANDS: 面向医学培训的手术手势与错误识别多视角数据集与基准测试
计算机视觉与模式识别
2026-03-30 v1
摘要
在医学生外科培训中,熟练度的提升依赖于专家主导的技能评估,这种评估成本高、耗时有限、难以规模化,且其专业知识仅限于拥有可用专家的机构。基于自动化的 AI 评估提供了一种可行的替代方案,但进展受到缺乏包含真实学员错误的数据集以及训练鲁棒计算机视觉方法所需的多视角变异性的制约。为弥补这一空白,我们提出了 Surgical-Hands (SHands),一个用于医学培训的手术手势与错误识别的大规模多视角视频数据集。SHands 使用五个互补视角的 RGB 摄像机捕捉线性切开和缝合操作,由 52 名参与者(20 名专家和 32 名学员)完成,每位参与者针对每个手术步骤完成三次标准化试验。视频在帧级别标注了 15 种手势基元,并包含经过验证的 8 种学员错误类型分类体系,从而支持手势识别和错误检测。我们进一步定义了单视角、多视角和跨视角泛化的标准化评估协议,并在该数据集上对最先进的深度学习模型进行了基准测试。SHands 已公开发布,以支持基于临床整理领域知识的鲁棒且可扩展的外科培训 AI 系统的开发。
引用
@article{arxiv.2603.26400,
title = {SHANDS: A Multi-View Dataset and Benchmark for Surgical Hand-Gesture and Error Recognition Toward Medical Training},
author = {Le Ma and Thiago Freitas dos Santos and Nadia Magnenat-Thalmann and Katarzyna Wac},
journal= {arXiv preprint arXiv:2603.26400},
year = {2026}
}