中文

基于多模态图表示学习与对抗特征解耦的鲁棒手术工作流识别

计算机视觉与模式识别 2025-05-06 v1 机器人学

摘要

手术工作流识别对于自动化任务、支持决策和培训新手外科医生至关重要,最终可提高患者安全并标准化手术流程。然而,由于手术场景中出血或烟雾造成的遮挡以及数据存储和传输问题,数据损坏可能导致性能下降。为此,我们探索了一种鲁棒的基于图的多模态方法,整合视觉和运动学数据以提高准确性和可靠性。视觉数据捕获动态手术场景,而运动学数据提供精确的运动信息,克服了在不利条件下视觉识别的局限性。我们提出了一种用于在具有域偏移或数据损坏的挑战性场景中进行鲁棒手术工作流识别的多模态图表示网络与对抗特征解耦(GRAD)方法。具体来说,我们引入了一个多模态解耦图网络,该网络捕获细粒度视觉信息,同时通过基于图的消息传递建模显式地建模视觉和运动学嵌入之间的复杂关系。为了跨模态对齐特征空间,我们提出了一个视觉-运动学对抗框架,利用对抗训练来减少模态差距并提高特征一致性。此外,我们设计了一个上下文校准解码器,融合时间和上下文先验,以增强对域偏移和损坏数据的鲁棒性。大量的比较和消融实验证明了我们模型及所提出模块的有效性。此外,我们的鲁棒性实验表明,我们的方法能有效处理存储和传输过程中的数据损坏,展现出优异的稳定性和鲁棒性。我们的方法旨在推进自动化手术工作流识别,解决手术过程中固有的复杂性和动态性。

关键词

引用

@article{arxiv.2505.01766,
  title  = {Multimodal Graph Representation Learning for Robust Surgical Workflow Recognition with Adversarial Feature Disentanglement},
  author = {Long Bai and Boyi Ma and Ruohan Wang and Guankun Wang and Beilei Cui and Zhongliang Jiang and Mobarakol Islam and Zhe Min and Jiewen Lai and Nassir Navab and Hongliang Ren},
  journal= {arXiv preprint arXiv:2505.01766},
  year   = {2025}
}

备注

Accepted by Information Fusion