中文

基于 BiomedCLIP-PubMedBERT 的内镜 VCE 图像分类的多模态方法

计算机视觉与模式识别 2024-12-25 v3

摘要

本文提出了一种高级方法,用于微调 BiomedCLIP PubMedBERT,这是一种多模态模型,以分类 Video Capsule Endoscopy (VCE) 帧中的异常情况,旨在提高胃肠道医疗诊断效率。通过将 PubMedBERT 语言模型与视觉 Transformer (ViT) 集成以处理内镜图像,我们的方法将图像分为十个特定类别:血管扩张、出血、溃疡、红润、异体物、淋巴管扩张、息肉、溃疡、虫虫和正常。我们的工作流程包括图像预处理和微调 BiomedCLIP 模型以为视觉和文本输入生成高质量的嵌入,通过相似度评分进行对齐以进行分类。性能指标,包括分类、准确率、召回率和 F1 分数,表明该模型具有强大的准确识别内镜帧中异常的能力,显示出在临床诊断中实际应用的前景。

关键词

引用

@article{arxiv.2410.19944,
  title  = {A Multimodal Approach For Endoscopic VCE Image Classification Using BiomedCLIP-PubMedBERT},
  author = {Nagarajan Ganapathy and Podakanti Satyajith Chary and Teja Venkata Ramana Kumar Pithani and Pavan Kavati and Arun Kumar S},
  journal= {arXiv preprint arXiv:2410.19944},
  year   = {2024}
}

备注

11 Pages, 2 Figures, Capsule Vision 2024 Challenge