中文

通用手术视觉 Transformer:用于通用手术的视频预训练基础模型

计算机视觉与模式识别 2024-04-16 v3 机器学习 组织与器官

摘要

缺乏公开可获取的数据和专用基础模型是手术计算研究的主要障碍。为此,(i) 我们开源了迄今为止最大的通用手术视频数据集,包含 680 小时的手术视频,涵盖 28 种术式的机器人和腹腔镜技术数据;(ii) 我们提出了一种基于前向视频预测的技术,用于在手术视频上预训练通用手术视觉 Transformer(GSViT),该技术可实时运行于手术应用,为此我们开源了 GSViT 的代码和权重;(iii) 我们还发布了针对 10 种术式微调的 GSViT 版本的代码和权重;(iv) 我们展示了 GSViT 在 Cholec80 阶段标注任务上的性能,其表现优于最先进的单帧预测器。

关键词

引用

@article{arxiv.2403.05949,
  title  = {General surgery vision transformer: A video pre-trained foundation model for general surgery},
  author = {Samuel Schmidgall and Ji Woong Kim and Jeffrey Jopling and Axel Krieger},
  journal= {arXiv preprint arXiv:2403.05949},
  year   = {2024}
}