中文

通过多模态图像融合实现眼科手术中全面实时场景理解

计算机视觉与模式识别 2026-03-27 v1

摘要

目的:将多模态成像集成到手术室为实现全面手术场景理解之路。目前,在眼科手术中,可获得两种互补成像模态:手术显微镜 (OPMI) 成像和实时内手术光学相干断层扫描 (iOCT)。本文是首次实现 OPMI 和 iOCT 特征融合,以实现多头预测,以眼科视网膜手术中精确的仪器跟踪为例,展示了多模态图像处理的潜力。方法:我们提出一种多模态、时序、具实时处理能力的网络架构,用于联合仪器检测、关键点定位和工具-组织距离估计。我们的网络设计集成了跨注意力融合模块,以高效提取 OPMI 和 iOCT 图像特征,分别通过 YoloNAS 和 CNN 编码器实现。此外,基于区域的循环模块利用时序一致性。结果:我们的实验表明,仪器定位和关键点检测可靠 (95.79% mAP50),且仪器-组织距离估计显著受益于 iOCT 的融合,同时实现每帧 22.5 ms 的实时处理速度。尤其对于靠近视网膜的距离 (低于 1 mm),距离估计精度从 284 微米 (OPMI 单模态) 提升至 33 微米 (多模态)。结论:多模态成像的特征融合可提高多任务预测精度,针对网络设计的实时处理性能可实现。虽然我们的结果表明多模态处理对视网膜手术具有潜力,但也凸显了实现更可靠、一致且全面的手术场景理解所面临的关键挑战,激励了未来的研究。

关键词

引用

@article{arxiv.2603.25555,
  title  = {Towards Comprehensive Real-Time Scene Understanding in Ophthalmic Surgery through Multimodal Image Fusion},
  author = {Nikolo Rohrmoser and Ghazal Ghazaei and Michael Sommersperger and Nassir Navab},
  journal= {arXiv preprint arXiv:2603.25555},
  year   = {2026}
}