基于事件驱动图挖掘的策略监督式自主腔镜相机控制
机器人学
2026-02-25 v1 计算机视觉与模式识别
摘要
自主腔镜相机控制必须在快速工具-组织相互作用下保持稳定安全的手术视野,同时保持对外科医生的可解释性。我们提出一种基于策略的框架,将高层视觉-语言推理与低层闭环控制相结合。离线方面,原始手术视频被解析为相机相关的时序事件(例如,相互作用、工作距离偏差和视野质量退化),并结构化为带属性的事件图。从这些图中挖掘可获得一组可重用的相机处理策略原语,这些原语为学习提供结构化的监督。在线方面,微调的视觉-语言模型(VLM)处理实时腔镜视图,预测主导策略和离散图像-based 动作命令,由 IBVS-RCM 控制器在严格安全约束下执行;可选的语音输入 enables intuitive 人机循环 conditioning。在一个由外科医生标注的数据集上,事件解析实现可靠的时序局部化(F1 分数 0.86),挖掘的策略显示与专家解释的强语义对齐(聚类纯度 0.81)。大量体外实验在硅胶幻影和猪肌组织上表明,所提出的系统在标准化的相机处理评估中优于初级外科医生,减少了视野居中误差 35.26% 和图像抖动 62.33%,同时保持平滑运动和稳定的工作距离 regulation。
引用
@article{arxiv.2602.20500,
title = {Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining},
author = {Keyu Zhou and Peisen Xu and Yahao Wu and Jiming Chen and Gaofeng Li and Shunlei Li},
journal= {arXiv preprint arXiv:2602.20500},
year = {2026}
}
备注
Submitted to IEEE Transactions on Robotics (T-RO). 19 pages, 9 figures