中文

基于手术仪器-组织相互作用的轨迹预测:面向视觉-语言模型的 Trajectory-Conditioned 联合嵌入预测

计算机视觉与模式识别 2026-03-17 v3

摘要

识别仪器与组织之间的相互作用是构建情境感知 AI 助手的关键。视觉-语言模型(Vision-Language Models,VLMs)为手术感知提供了新的途径,并在广泛的任务上实现了比传统任务特定深度学习方法更好的泛化。然而,其在仪器-组织相互作用识别上的表现仍有限,主要源于两个挑战:(1)许多模型未有效利用时序信息,(2)视觉与文本之间的对齐常常忽略细粒度的动作细节。为此,我们提出了 TrajPred 框架,通过编码仪器轨迹来融合时序运动线索,并以这些轨迹为条件,引入预测模块生成视觉语义嵌入,以更好地捕获细粒度的动作细节。我们进一步采用 prompt tuning 和动词重述技术,以实现对仪器-组织相互作用识别任务的顺畅适配。在针对公开腹腔手术基准数据集 CholecT50 的大量实验中,我们的方法在 Average Precision 和 Top-K 准确率上均取得改进。我们还通过可视化仪器-组织相互作用区域的视觉嵌入与对应文本之间的余弦相似度,探讨了这些视觉嵌入是否更好地与文本对齐。可视化结果表明,所提方法改善了相关视觉与文本表征之间的对齐。

关键词

引用

@article{arxiv.2603.06999,
  title  = {TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models},
  author = {Jiajun Cheng and Xiaofan Yu and Subarna Tripathi and Sainan Liu and Shan Lin},
  journal= {arXiv preprint arXiv:2603.06999},
  year   = {2026}
}