基于扩散模型的手术三联体识别
计算机视觉与模式识别
2024-06-25 v2 人工智能
摘要
手术三联体识别是实现下一代情境感知手术室的关键构建模块。其目标是识别手术视频帧中呈现的器械、动词和目标的组合。在本文中,我们提出了DiffTriplet,一种采用扩散模型的手术三联体识别新生成框架,它通过迭代去噪来预测手术三联体。为了处理三联体关联的挑战,我们的扩散框架中提出了两种独特的设计,即关联学习和关联引导。在训练期间,我们在三联体和单个组件的联合空间中优化模型,以捕获它们之间的依赖关系。在推理时,我们将关联约束整合到迭代去噪过程的每次更新中,该过程利用单个组件的信息来细化三联体预测。在CholecT45和CholecT50数据集上的实验表明,所提出的方法在实现手术三联体识别的最新性能方面具有优越性。我们的代码将发布。
引用
@article{arxiv.2406.13210,
title = {Surgical Triplet Recognition via Diffusion Model},
author = {Daochang Liu and Axel Hu and Mubarak Shah and Chang Xu},
journal= {arXiv preprint arXiv:2406.13210},
year = {2024}
}