动态场景下手术动作的声源定位用于空间映射
声音
2026-05-05 v3 计算机视觉与模式识别
音频与语音处理
图像与视频处理
摘要
目的:手术场景理解是推进计算机辅助和智能手术系统的关键。当前方法主要依赖视觉数据或端到端学习,限制了对细粒度情境建模的能力。本工作旨在通过整合3D声学信息,增强手术场景的表征,实现手术环境的时间和空间感知的多模态理解。方法:我们提出了一种新框架,用于生成手术场景的4D音频-视觉表征,通过将全相位麦克风阵列的声学定位信息投影到来自RGB-D相机的动态点云上。基于变换器的声学事件检测模块识别包含工具-组织相互作用的相关时间段,并在音频-视觉场景表征中进行空间定位。该系统在真实操作室环境中通过专家模拟手术程序进行了实验评估。结果:所提方法成功地在3D空间中定位手术声学事件并将其与视觉场景元素关联。实验评估表明,本方法实现了准确的空间声源定位和稳健的多模态数据融合,为手术活动的综合、动态表示提供了基础。结论:本工作首次提出了动态手术场景中的空间声源定位方法,标志着多模态手术场景表征的重大进展。通过整合声学和视觉数据,所提框架实现了更丰富的情境理解,为未来智能和自主手术系统提供了基础。
引用
@article{arxiv.2510.24332,
title = {Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes},
author = {Jonas Hein and Lazaros Vlachopoulos and Maurits Geert Laurent Olthof and Bastian Sigrist and Philipp Fürnstahl and Matthias Seibold},
journal= {arXiv preprint arXiv:2510.24332},
year = {2026}
}