迈向整体手术场景理解
计算机视觉与模式识别
2024-01-29 v4 人工智能
摘要
大多数研究手术干预的基准聚焦于单一挑战,而非利用不同任务间的内在互补性。本工作中,我们提出一种面向整体手术场景理解的新实验框架。首先,我们引入阶段、步骤、器械与原子视觉动作识别(PSI-AVA)数据集。PSI-AVA包含机器人辅助根治性前列腺切除术视频中长时程(阶段与步骤识别)与短时程推理(器械检测与新提出的原子动作识别)的标注。其次,我们提出用于动作、阶段、器械与步骤识别的Transformers(TAPIR)作为手术场景理解的强基线。TAPIR利用我们数据集的多级标注,因其受益于器械检测任务上习得的表征以提升其分类能力。我们在PSI-AVA及其他公开数据库上的实验结果表明,我们的框架足以推动未来关于整体手术场景理解的研究。
引用
@article{arxiv.2212.04582,
title = {Towards Holistic Surgical Scene Understanding},
author = {Natalia Valderrama and Paola Ruiz Puentes and Isabela Hernández and Nicolás Ayobi and Mathilde Verlyk and Jessica Santander and Juan Caicedo and Nicolás Fernández and Pablo Arbeláez},
journal= {arXiv preprint arXiv:2212.04582},
year = {2024}
}
备注
MICCAI 2022 Oral. Official extension published at arXiv:2401.11174 . Data and codes available at https://github.com/BCV-Uniandes/TAPIR