SurgFusion-Net:用于外科技能评估的多模态融合网络
机器人学
2026-03-03 v1 人工智能
摘要
机器人辅助手术(RAS)已在临床实践中得到普及,利用多模态数据进行自动化外科技能评估具有变革性潜力,可推动手术分析和教育。然而,由于任务复杂性、标注数据有限以及跨模态信息融合技术不足,开发有效的多模态方法仍然具有挑战性。现有最先进方法仅依赖RGB视频,并仅适用于干燥实验室环境,无法弥合受控仿真与真实临床案例之间的显著领域差距。在后者中,手术环境以及摄像机和组织运动引入了巨大的复杂性。本文引入SurgFusion-Net和差分调节注意力(DRA)机制,这是一种用于多模态外科技能评估的创新性融合策略。我们贡献了两个首创的临床数据集:包含37个机器人辅助子宫切除(RAH)视频中279,691个RGB帧的RAH-skill数据集,以及包含33个机器人辅助原位前列腺切除(RARP)视频中70,661个RGB帧的RARP-skill数据集。两个数据集均包含M-GEARS技能标注、对应运动光流和工具分割掩码。DRA融合基于手术语境的自适应双注意力和多头注意力,以增强多样性,融合来自三个模态的信息,提高评估准确性和可靠性。在JIGSAWS基准、RAH-skill和RARP-skill数据集上进行的验证表明,我们的方法在JIGSAWS任务中LOSO提升0.02,在LOUO提升0.04,在RAH-skill和RARP-skill上分别提升0.0538和0.0493。
引用
@article{arxiv.2603.00108,
title = {SurgFusion-Net: Diversified Adaptive Multimodal Fusion Network for Surgical Skill Assessment},
author = {Runlong He and Freweini M. Tesfai and Matthew W. E. Boal and Nazir Sirajudeen and Dimitrios Anastasiou and Jialang Xu and Mobarak I. Hoque and Philip J. Edwards and John D. Kelly and Ashwin Sridhar and Abdolrahim Kadkhodamohammadi and Dhivya Chandrasekaran and Matthew J. Clarkson and Danail Stoyanov and Nader Francis and Evangelos B. Mazomenos},
journal= {arXiv preprint arXiv:2603.00108},
year = {2026}
}