SurgTPGS:基于文本可提示的高斯溅射语义 3D 手术场景理解
图像与视频处理
2025-07-02 v2 计算机视觉与模式识别
摘要
在当代手术研究与实践中,准确理解具备文本可提示能力的 3D 手术场景尤为关键,这对于手术规划和实时内操作指导至关重要,精确识别和与手术工具及解剖结构互动更为重要。然而,现有研究仅分别关注手术视觉-语言模型 (VLM)、3D 重建和分割,缺乏对实时文本可提示 3D 查询的支持。本文提出了 SurgTPGS,一种新的文本可提示的高斯溅射方法,以弥补这一空白。我们引入一种集成 Segment Anything 模型和最先进视觉-语言模型的 3D 语义特征学习策略。我们提取分段语言特征用于 3D 手术场景重建,实现对复杂手术环境的深入理解。我们还提出了语义感知变形跟踪,以捕捉语义特征的无缝变形,为纹理和语义特征的更精确重建提供支持。此外,我们提出语义区域感知优化,利用区域化语义信息对训练进行监督,特别提升了重建质量和语义平滑度。我们在两个真实世界的手术数据集上进行了全面实验,表明 SurgTPGS 在最先进方法之上具有优势,凸显了其在手术实践中的潜力。SurgTPGS 为开发下一代智能手术系统铺平了道路,通过提升手术精度和安全性。我们的代码已公开:https://github.com/lastbasket/SurgTPGS。
引用
@article{arxiv.2506.23309,
title = {SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting},
author = {Yiming Huang and Long Bai and Beilei Cui and Kun Yuan and Guankun Wang and Mobarak I. Hoque and Nicolas Padoy and Nassir Navab and Hongliang Ren},
journal= {arXiv preprint arXiv:2506.23309},
year = {2025}
}
备注
MICCAI 2025. Project Page: https://lastbasket.github.io/MICCAI-2025-SurgTPGS/