通过优化聚合网络在教学模式白内障手术视频中识别手术器械
计算机视觉与模式识别
2025-01-07 v1
摘要
教学白内障手术视频对于眼科医生和受训者反复观察手术细节至关重要。本文提出了一个深度学习模型,用于从开放获取来源抓取的自定义数据集中实时识别这些视频中的手术器械。受 YOLOV9 架构启发,该模型采用可编程梯度信息(PGI)机制和一种新颖的广义优化高效层聚合网络,以解决信息瓶颈问题,从而在较高的非极大值抑制交并比分数下提升最小平均精度。在包含 10 个器械类别的 615 张图像的数据集上,Go-ELAN YOLOV9 模型与 YOLO v5、v7、v8、v9 vanilla、Laptool 和 DETR 进行了对比评估,在 IoU 0.5 时达到了 73.74 的优异 mAP,证明了所提出模型的有效性。
引用
@article{arxiv.2501.02618,
title = {Identifying Surgical Instruments in Pedagogical Cataract Surgery Videos through an Optimized Aggregation Network},
author = {Sanya Sinha and Michal Balazia and Francois Bremond},
journal= {arXiv preprint arXiv:2501.02618},
year = {2025}
}
备注
Preprint. Full paper accepted at the IEEE International Conference on Image Processing Applications and Systems (IPAS), Lyon, France, Jan 2025. 6 pages