基于帧相似性和外科工具跟踪的高效帧提取:一种用于视频分割的新方法
计算机视觉与模式识别
2025-05-28 v3
摘要
近年来,利用人工智能(AI)对外科手术进行自动化分析的兴趣显著上升。用于记录外科手术并进行后续分析(如绩效评估)的主要工具是视频。然而,这些手术视频相较于其他领域显得异常冗长,时长从三十分钟到多个小时,这给 AI 模型的有效学习带来了挑战。尽管存在这一挑战,近期手术视频量的可预见增长仍然迫切需要开发和实施创新技术来有效应对。本文提出了一种新技术,称为动力学自适应帧识别(Kinematics Adaptive Frame Recognition, KAFR),可有效消除冗余帧以减少数据集大小和计算时间,同时保留有用帧以提高准确率。具体而言,我们通过跟踪外科工具的运动来计算连续帧之间的相似性。我们的 метод包括三个步骤: 跟踪阶段:利用 YOLOv8 模型检测场景中出现的工具; 相似性阶段:通过估计工具的空间位置和速度变化来计算连续帧之间的相似性; 分类阶段:训练 X3D CNN 进行分割分类。我们通过分析来自两家 referral 中心的回顾性病例数据进行评估。新标注的胃肠吻合手术(Gastrojejunostomy, GJ)数据集覆盖 2017 年至 2021 年的手术记录,而之前标注的胰腺肠吻合手术(Pancreaticojejunostomy, PJ)数据集则跨越 2011 年至 2022 年。
引用
@article{arxiv.2501.11153,
title = {Efficient Frame Extraction: A Novel Approach Through Frame Similarity and Surgical Tool Tracking for Video Segmentation},
author = {Huu Phong Nguyen and Shekhar Madhav Khairnar and Sofia Garces Palacios and Amr Al-Abbas and Melissa E. Hogg and Amer H. Zureikat and Patricio M. Polanco and Herbert Zeh and Ganesh Sankaranarayanan},
journal= {arXiv preprint arXiv:2501.11153},
year = {2025}
}
备注
18