中文

将手术视频编码为潜在时空图以实现对象和解剖驱动的推理

计算机视觉与模式识别 2023-12-13 v1

摘要

近年来,时空图已成为一种简洁优雅的以对象为中心表示视频片段的方式,并已被证明对动作识别等下游任务有用。在本工作中,我们研究使用潜在时空图来表示手术视频中的组成解剖结构和工具及其随时间演化的属性。为了构建图,我们首先使用预训练模型预测逐帧图,然后基于空间一致性以及视觉和语义相似性在节点之间添加时间边。与之前的方法不同,我们在图中加入了长期时间边,以更好地建模手术场景的演化并增强对临时遮挡的鲁棒性。我们还引入了一个新颖的图编辑模块,该模块结合先验知识和时间一致性来纠正图中的错误,从而提升下游任务性能。利用我们的图表示,我们评估了两个下游任务:安全关键视图预测和手术阶段识别,获得了强有力的结果,证明了所学表示的质量和灵活性。代码可在github.com/CAMMA-public/SurgLatentGraph获取。

关键词

引用

@article{arxiv.2312.06829,
  title  = {Encoding Surgical Videos as Latent Spatiotemporal Graphs for Object and Anatomy-Driven Reasoning},
  author = {Aditya Murali and Deepak Alapatt and Pietro Mascagni and Armine Vardazaryan and Alain Garcia and Nariaki Okamoto and Didier Mutter and Nicolas Padoy},
  journal= {arXiv preprint arXiv:2312.06829},
  year   = {2023}
}

备注

13 pages, 2 figures, MICCAI 2023