中文

基于 3D 大规模预训练模型的人工智能框架用于喉部癌检测——基于喉镜视频

计算机视觉与模式识别 2024-09-04 v1

摘要

喉部癌是一种具有高死亡率的恶性疾病,对人类健康构成严重威胁。传统方法需要喉镜医师手动检查喉镜视频,这既耗时又主观。本研究提出一种新型自动框架,通过 3D 大规模预训练模型(称为 3D-LSPTM)实现喉部癌检测。首先,我们从中国Sun Yat-sen 大学附属医院收集了 1,109 份喉镜视频(经伦理委员会批准)。随后,我们利用 3D 大规模预训练模型(C3D、TimeSformer 和 Video-Swin-Transformer),利用其先进的视频特征提取优势,对喉部癌进行检测并采用微调技术。大量实验表明,我们提出的 3D-LSPTM 在喉部癌检测任务上表现优异。特别地,采用 Video-Swin-Transformer 作为主干网络的 3D-LSPTM 可实现 92.4% 的准确率、95.6% 的灵敏度、94.1% 的精确率和 94.8% 的 F_1 分值。

关键词

引用

@article{arxiv.2409.01459,
  title  = {3D-LSPTM: An Automatic Framework with 3D-Large-Scale Pretrained Model for Laryngeal Cancer Detection Using Laryngoscopic Videos},
  author = {Meiyu Qiu and Yun Li and Wenjun Huang and Haoyun Zhang and Weiping Zheng and Wenbin Lei and Xiaomao Fan},
  journal= {arXiv preprint arXiv:2409.01459},
  year   = {2024}
}