中文

SurgPETL:面向手术阶段识别的参数高效图像到手术视频迁移学习

计算机视觉与模式识别 2024-10-01 v1

摘要

利用图像级预训练模型处理各种下游任务已展现出令人瞩目的性能。然而,针对高维视频数据的“图像预训练后视频微调”范式不可避免地带来了显著的性能瓶颈。此外,在医学领域,许多手术视频任务还面临着视频数据有限和全面时空建模需求所带来的额外挑战。近年来,参数高效图像到视频迁移学习已成为视频动作识别任务中一种高效且有效的范式,它利用具有良好特征迁移性的图像级预训练模型,并以最少的微调进行跨模态时间建模。然而,该范式在复杂手术领域的有效性和泛化性尚未得到探索。在本文中,我们深入探讨了一个新问题:高效地将图像级预训练模型适应于细粒度手术阶段识别,称为参数高效图像到手术视频迁移学习。首先,我们为手术阶段识别开发了一个参数高效迁移学习基准SurgPETL,并基于两种不同规模的ViT在五个大规模自然和医学数据集上预训练的模型,对三种先进方法进行了广泛实验。然后,我们引入了时空适应模块,该模块集成了标准空间适配器与新颖的时间适配器,以捕获详细的空间特征并建立跨时间序列的连接,从而实现稳健的时空建模。在涵盖多种手术流程的三个具有挑战性的数据集上的广泛实验证明了SurgPETL与STA的有效性。

关键词

引用

@article{arxiv.2409.20083,
  title  = {SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition},
  author = {Shu Yang and Zhiyuan Cai and Luyang Luo and Ning Ma and Shuchang Xu and Hao Chen},
  journal= {arXiv preprint arXiv:2409.20083},
  year   = {2024}
}

备注

submitted to TMI