通用手术视觉 Transformer:用于通用手术的视频预训练基础模型
计算机视觉与模式识别
2024-04-16 v3 机器学习
组织与器官
摘要
缺乏公开可获取的数据和专用基础模型是手术计算研究的主要障碍。为此,(i) 我们开源了迄今为止最大的通用手术视频数据集,包含 680 小时的手术视频,涵盖 28 种术式的机器人和腹腔镜技术数据;(ii) 我们提出了一种基于前向视频预测的技术,用于在手术视频上预训练通用手术视觉 Transformer(GSViT),该技术可实时运行于手术应用,为此我们开源了 GSViT 的代码和权重;(iii) 我们还发布了针对 10 种术式微调的 GSViT 版本的代码和权重;(iv) 我们展示了 GSViT 在 Cholec80 阶段标注任务上的性能,其表现优于最先进的单帧预测器。
引用
@article{arxiv.2403.05949,
title = {General surgery vision transformer: A video pre-trained foundation model for general surgery},
author = {Samuel Schmidgall and Ji Woong Kim and Jeffrey Jopling and Axel Krieger},
journal= {arXiv preprint arXiv:2403.05949},
year = {2024}
}