基于YOLOv10的多任务框架:手术视频中的手部定位与左右手分类
计算机视觉与模式识别
2026-02-24 v1
摘要
在创伤手术中,实时手部追踪对于支持快速且精确的术中决策至关重要。我们提出了一种基于YOLOv10的框架,能够在复杂的手术场景中同时定位手部并分类其左右属性。该模型在Trauma THOMPSON Challenge 2025 Task 2数据集上训练,该数据集包含带有手部边界框标注的第一人称手术视频。广泛的数据增强和多任务检测设计提高了模型对运动模糊、光照变化和多样化手部外观的鲁棒性。评估结果表明,左手(67%)和右手(71%)的分类准确,但将手部与背景区分开来仍然具有挑战性。该模型达到了0.33的,并保持了实时推理能力,凸显了其术中部署的潜力。这项工作为急诊手术过程中高级手-器械交互分析奠定了基础。
引用
@article{arxiv.2602.18959,
title = {YOLOv10-Based Multi-Task Framework for Hand Localization and Laterality Classification in Surgical Videos},
author = {Kedi Sun and Le Zhang},
journal= {arXiv preprint arXiv:2602.18959},
year = {2026}
}