SurgMAE:用于长手术视频分析的掩码自编码器
计算机视觉与模式识别
2023-05-22 v1
摘要
使用深度学习模型处理长手术视频以自动检测临床/操作活动并提取可用于工作流效率工具与应用的指标,正引起越来越多的关注。然而,训练此类模型需要大量标注数据,成本高且难以扩展。近来,计算机视觉领域探索了自监督学习以减轻标注成本负担。掩码自编码器(MAE)通过在给定图像或视频片段的可见块时预测随机掩码区域,在 Vision Transformers(ViTs)的自监督范式中受到关注,并在基准数据集上展现出优越性能。然而,MAE 在手术数据中的应用仍待探索。本文首先探究 MAE 是否能在手术视频领域学习可迁移表征。我们提出 SurgMAE,这是一种基于高时空 token 采样的掩码策略的新型架构。我们在两个大规模长手术视频数据集上对 SurgMAE 进行了实证研究,发现我们的方法在低数据场景下优于若干基线。我们进行了大量消融实验以展示方法的有效性,并在 UCF-101 上证明其优越性能,以表明其在非手术数据集上的泛化能力。
引用
@article{arxiv.2305.11451,
title = {SurgMAE: Masked Autoencoders for Long Surgical Video Analysis},
author = {Muhammad Abdullah Jamal and Omid Mohareri},
journal= {arXiv preprint arXiv:2305.11451},
year = {2023}
}