中文

手术视频中无训练时序物体跟踪

计算机视觉与模式识别 2026-03-10 v1

摘要

目的:本文提出一种新方法,用于腹腔动脉切除术(LC)手术视频中的在线目标跟踪,旨在实现对关键解剖结构和器械的局部分辨和跟踪。本方法解决了现有数据集中高昂的像素级标注成本以及标签不一致性的问题。方法:我们利用预训练文本到图像扩散模型中内置的目标局部分辨能力,从手术帧中提取代表性特征,无需任何训练或微调。我们的跟踪框架使用这些特征,以及受查询-键-值注意力启发的跨帧相互作用矩阵,确保跟踪过程中的时间连续性。结果:通过 pilots 研究,我们首先演示扩散特征在不同解码器层级和时间帧中表现出优越的目标局部分辨和一致的语义。随后,我们进行大量实验以验证方法的有效性,展示其在时序目标跟踪任务中优于对手。具体而言,在公开可用的 CholeSeg8K 数据集上,我们实现了79.19%的像素级分类准确率、56.20%的平均 Jaccard 得分和79.48%的平均 F 分数。结论:我们的工作不仅引入了文本到图像扩散模型的新应用,还推动了手术视频分析领域的发展,为在 minimally invasive手术视频中实现准确且高成本效益的时序目标跟踪提供了有前景的途径。

关键词

引用

@article{arxiv.2603.07839,
  title  = {Training-free Temporal Object Tracking in Surgical Videos},
  author = {Subhadeep Koley and Abdolrahim Kadkhodamohammadi and Santiago Barbarisi and Danail Stoyanov and Imanol Luengo},
  journal= {arXiv preprint arXiv:2603.07839},
  year   = {2026}
}

备注

Accepted in IPCAI 2025