基于仪器实例分割锚定外科动作三元组:一个数据集和面向靶向的融合方法
计算机视觉与模式识别
2026-04-09 v1
摘要
理解外科仪器-组织相互作用不仅需要识别哪个仪器对哪个解剖靶标执行哪个动作,还需要在手术场景中对这些相互作用进行空间锚定。现有的外科动作三元组识别方法局限于从帧级分类学习,无法可靠地将动作链接到特定的仪器实例。先前的空间锚定尝试主要依赖于类激活图,这些方法在精确性和鲁棒性方面不足以满足详细的仪器-组织相互作用分析。为此,我们提出了将外科动作三元组与仪器实例分割锚定,或简称为短时三元组分割,一种新的统一任务,产生空间锚定的<仪器、动词、靶标>输出。我们首先提出CholecTriplet-Seg,一个包含30,000多个标注帧的大规模数据集,将仪器实例掩码与动作动词和解剖靶标注释链接,并建立了强监督、实例级三元组锚定和评估的第一个基准。为学习三元组分割,我们提出了TargetFusionNet,一种新型架构,将Mask2Former扩展为靶向融合机制,以解决精确解剖靶标预测的挑战,通过融合弱解剖先验与仪器实例查询。评估结果表明,TargetFusionNet在识别、检测和三元组分割指标上均一致优于现有基线,表明强实例监督结合弱靶标先验显著提升了外科动作理解的准确性和鲁棒性。三元组分割为空间锚定外科动作三元组建立了统一框架。提出的基准和架构为更具可解释性的手术场景理解指明了道路。
引用
@article{arxiv.2511.00643,
title = {Grounding Surgical Action Triplets with Instrument Instance Segmentation: A Dataset and Target-Aware Fusion Approach},
author = {Oluwatosin Alabi and Meng Wei and Charlie Budd and Tom Vercauteren and Miaojing Shi},
journal= {arXiv preprint arXiv:2511.00643},
year = {2026}
}