面向视频引导下颌窦手术的交互式系统:说话、分割、跟踪、导航
计算机视觉与模式识别
2026-04-17 v2
摘要
我们介绍一个面向视频引导下颌窦手术的语音引导具身智能体框架,动态响应外科医生查询,执行感知与图像引导任务。该系统将自然语言交互与实时视觉感知集成于活体内视频流上,使外科医生无需离开操作任务即可请求计算性辅助。不同于依赖外部光学跟踪器及额外硬件 setup的传统图像引导导航系统,本框架纯基于内操作视频实现。系统启动时进行交互式分割与手术器械标注。分割后的器械作为空间锚点被自动跟踪于视频流中,以支持后续工作流程,包括解剖学分割、预操作3D模型的交互式配准、基于单目视频的手术工具姿态估计,以及通过实时解剖学叠加实现图像引导。我们在视频引导下颌窦手术情景中评估了所提系统,并将其跟踪性能与商业级光学跟踪系统进行基准测试。在三个实验试验中,混合视觉方法在相机坐标系下实现了手术器械针尖位置误差的平均绝对值为2.32±1.10 mm,帧间 yaw 与 pitch 传播误差分别为0.18±0.25°与0.21±0.30°。该系统在约两分钟内完成器械分割与解剖配准,显著降低了相对于传统跟踪工作流程的 setup 复杂度。这些结果表明,语音引导的具身智能体可在提高工作流程集成度的同时提供准确的空间引导,实现视频引导手术系统的快速部署。
引用
@article{arxiv.2603.16024,
title = {Speak, Segment, Track, Navigate: An Interactive System for Video-Guided Skull-Base Surgery},
author = {Jecia Z. Y. Mao and Francis X. Creighton and Russell H. Taylor and Manish Sahu},
journal= {arXiv preprint arXiv:2603.16024},
year = {2026}
}