中文

EndoDINO:用于胃肠内窥镜的基础模型

计算机视觉与模式识别 2025-03-21 v1 图像与视频处理

摘要

在这项工作中,我们提出了EndoDINO,一个用于胃肠内窥镜任务的基础模型,通过在从文献中已知最大的胃肠内窥镜视频数据集中采样的精心策划的图像数据集上进行预训练,实现了强大的泛化能力。具体来说,我们使用从10万到1000万张策划图像的数据集,预训练了具有1B、307M和86M参数的ViT模型。使用EndoDINO作为冻结特征编码器,我们在解剖标志分类、息肉分割和溃疡性结肠炎的Mayo内镜评分(MES)方面,仅用简单的解码器头就实现了最先进的性能。

关键词

引用

@article{arxiv.2501.05488,
  title  = {EndoDINO: A Foundation Model for GI Endoscopy},
  author = {Patrick Dermyer and Angad Kalra and Matt Schwartz},
  journal= {arXiv preprint arXiv:2501.05488},
  year   = {2025}
}