SANGRIA: 手术视频场景图优化用于手术工作流程预测
计算机视觉与模式识别
2024-10-08 v2 人工智能
摘要
基于图的整体场景表示有助于理解手术工作流程,近期已在该任务中取得显著成功。然而,该任务常因稀疏标注的手术场景数据而受限。本文引入了一个用于生成和优化手术场景图的端到端框架,目标为下游任务。我们的做法利用图基谱系聚类的灵活性,以及基础模型的泛化能力,生成具有可学习属性的无监督场景图。我们通过利用连续帧之间的局部匹配,在初始空间图中加入稀疏的时间连接,以预测在时间邻域内的 temporally consistent 聚类。通过联合优化动态场景图的节点特征和时空关系,并针对阶段分割这一下游任务,我们解决了仅利用弱手术阶段标签即可完成语义场景理解和手术视频场景图生成的高成本和标注负担问题。进一步,通过在流水线中包含有效的中间场景表示解耦步骤,我们的解决方案在CATARACTS数据集上 outperform SOTA,以8%的准确率和10%的F1分数在手术工作流程识别中取得优异成绩。
引用
@article{arxiv.2407.20214,
title = {SANGRIA: Surgical Video Scene Graph Optimization for Surgical Workflow Prediction},
author = {Çağhan Köksal and Ghazal Ghazaei and Felix Holm and Azade Farshad and Nassir Navab},
journal= {arXiv preprint arXiv:2407.20214},
year = {2024}
}
备注
9 pages, 3 figures, 3 tables, MICCAI GRAIL Workshop paper