时间中的会合:一种基于注意力的时序融合方法用于手术三元组识别
计算机视觉与模式识别
2023-06-19 v2
摘要
手术 AI 近期的进展之一是将手术活动识别为(器械,动词,目标)的三元组。尽管这为计算机辅助介入提供了详细信息,当前的三元组识别方法仅依赖单帧特征。利用来自先前帧的时间线索将改善从视频中识别手术动作三元组。本文中,我们提出 Rendezvous in Time (RiT)——一种将最先进模型 Rendezvous 扩展以进行时间建模的深度学习模型。我们的 RiT 更关注动词,探索当前帧与过去帧的关联性,以学习基于时间注意力的特征,从而增强三元组识别。我们在具有挑战性的手术三元组数据集 CholecT45 上验证了我们的方案,展示了对动词和三元组以及涉及动词的其他交互(如(器械,动词))识别的提升。定性结果表明,RiT 对大多数三元组实例产生了比现有最优方法更平滑的预测。我们提出了一种新颖的基于注意力的方法,利用视频帧的时间融合来建模手术动作的演化,并发挥其优势用于手术三元组识别。
引用
@article{arxiv.2211.16963,
title = {Rendezvous in Time: An Attention-based Temporal Fusion approach for Surgical Triplet Recognition},
author = {Saurav Sharma and Chinedu Innocent Nwoye and Didier Mutter and Nicolas Padoy},
journal= {arXiv preprint arXiv:2211.16963},
year = {2023}
}
备注
Accepted at IPCAI, 2023. Project Page: https://github.com/CAMMA-public/rendezvous-in-time