面向整体手术场景理解的像素级识别
计算机视觉与模式识别
2024-12-30 v3 人工智能
机器学习
摘要
本文提出了前列腺切除术整体与多粒度手术场景理解数据集,这是一个经过精心整理的基准,将手术场景理解建模为具有不同粒度级别的互补任务层级。我们的方法涵盖了长期任务(如手术阶段和步骤识别)以及短期任务(包括手术器械分割和原子视觉动作检测)。为了利用我们提出的基准,我们引入了用于动作、阶段、步骤和器械分割的 Transformer(TAPIS)模型,这是一种通用架构,结合了全局视频特征提取器和来自器械分割模型的局部化区域提议,以应对我们基准的多粒度特性。通过在我们及替代基准上的大量实验,我们证明了 TAPIS 在不同任务中的多功能性和 SOTA 性能。这项工作代表了内窥镜视觉领域的基础性进展,为未来迈向整体手术场景理解的研究提供了新框架。
引用
@article{arxiv.2401.11174,
title = {Pixel-Wise Recognition for Holistic Surgical Scene Understanding},
author = {Nicolás Ayobi and Santiago Rodríguez and Alejandra Pérez and Isabela Hernández and Nicolás Aparicio and Eugénie Dessevres and Sebastián Peña and Jessica Santander and Juan Ignacio Caicedo and Nicolás Fernández and Pablo Arbeláez},
journal= {arXiv preprint arXiv:2401.11174},
year = {2024}
}
备注
Preprint submitted to Medical Image Analysis. Official extension of previous MICCAI 2022 (https://link.springer.com/chapter/10.1007/978-3-031-16449-1_42) and ISBI 2023 (https://ieeexplore.ieee.org/document/10230819) orals. Data and codes are available at https://github.com/BCV-Uniandes/GraSP