中文

基于YOLOv10的多任务框架:手术视频中的手部定位与左右手分类

计算机视觉与模式识别 2026-02-24 v1

摘要

在创伤手术中,实时手部追踪对于支持快速且精确的术中决策至关重要。我们提出了一种基于YOLOv10的框架,能够在复杂的手术场景中同时定位手部并分类其左右属性。该模型在Trauma THOMPSON Challenge 2025 Task 2数据集上训练,该数据集包含带有手部边界框标注的第一人称手术视频。广泛的数据增强和多任务检测设计提高了模型对运动模糊、光照变化和多样化手部外观的鲁棒性。评估结果表明,左手(67%)和右手(71%)的分类准确,但将手部与背景区分开来仍然具有挑战性。该模型达到了0.33的mAP[0.5:0.95]mAP_{[0.5:0.95]},并保持了实时推理能力,凸显了其术中部署的潜力。这项工作为急诊手术过程中高级手-器械交互分析奠定了基础。

关键词

引用

@article{arxiv.2602.18959,
  title  = {YOLOv10-Based Multi-Task Framework for Hand Localization and Laterality Classification in Surgical Videos},
  author = {Kedi Sun and Le Zhang},
  journal= {arXiv preprint arXiv:2602.18959},
  year   = {2026}
}