基于时空信息挖掘的标记合并用于手术视频理解
计算机视觉与模式识别
2025-09-30 v1
摘要
Vision Transformer 模型通过长程依赖建模在手术视频理解任务中展现出惊人的效果。然而,当前方法因处理跨视频帧的大量时空标记而导致计算成本高昂。虽然已有标记合并工作已推进模型效率,但未能充分考虑视频数据固有的时空结构,忽略信息分布的异构性,导致性能次优。本文提出了时空信息挖掘标记合并(STIM-TM)方法,代表着首个专为手术视频理解而设计的方法。STIM-TM 引入解耦策略,独立沿时间和空间维度减少标记冗余。具体而言,时序组件通过显著性加权合并来自连续帧中对应的空间标记,保留关键顺序信息并保持连续性。与此同时,空间组件通过时序稳定性分析优先合并静态标记,保护包含关键手术信息的动态区域。以无训练方式运行,STIM-TM 在综合的手术视频任务中实现显著的效率提升,降低超过 的 GFLOPs,同时保持具竞争力的准确率。该方法还支持高效训练长序列手术视频,解决手术应用中的计算瓶颈。
引用
@article{arxiv.2509.23672,
title = {Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding},
author = {Xixi Jiang and Chen Yang and Dong Zhang and Pingcheng Dong and Xin Yang and Kwang-Ting Cheng},
journal= {arXiv preprint arXiv:2509.23672},
year = {2025}
}