从相位 grounding 到智能外科叙事
计算机视觉与模式识别
2026-03-09 v1
摘要
手术时间轴是工具辅助手术的重要组成部分,使外科医生能够快速聚焦于程序的关键部分。当前方法涉及外科医生填写术后(OP)报告,而该报告往往模糊不清,或手动标注外科手术视频,耗时且费力。我们提出的方法处于这两个极端之间:我们旨在直接从外科手术视频中自动创建手术时间轴和叙事。为此,我们采用基于 CLIP 的多模态框架,将外科手术视频帧与文本手势描述对齐。具体而言,我们使用 CLIP 视觉编码器从外科手术视频帧中提取表征,并使用文本编码器将相应的手势句子嵌入共享的嵌入空间。我们随后对模型进行微调,以提高视频手势与文本标记之间的对齐程度。训练后,模型预测视频帧的手势和阶段,从而构建结构化的手术时间轴。该方法利用预训练的多模态表征来桥接视觉手势和文本叙事,减少了外科医生对手动视频审查和标注的需求。
引用
@article{arxiv.2603.05732,
title = {From Phase Grounding to Intelligent Surgical Narratives},
author = {Ethan Peterson and Huixin Zhan},
journal= {arXiv preprint arXiv:2603.05732},
year = {2026}
}