基于低秩适应(LoRA)学习适用于胶囊内镜诊断的基础模型
计算机视觉与模式识别
2024-07-02 v2
摘要
基础模型在计算机视觉中已成为热门任务,取得显著成就。然而,其有效性很大程度上取决于大规模数据集的预训练。直接从零应用基础模型到胶囊内镜图像的小数据集上具有挑战性。针对特定任务成功微调模型至关重要。本文引入一种简化方法,称为基于低秩适应(LoRA)技术的适配基础模型。我们的 метод受DINOv2基础模型启发,将低秩适应学习应用于胶囊内镜诊断。与传统微调方法不同,我们的策略包括设计用于吸收特定外科领域知识的LoRA层。在训练过程中,我们保持主要模型(主干编码器)固定,专注于优化LoRA层和疾病分类组件。我们在两个公开的胶囊内镜疾病分类数据集上测试了该方法。结果令人印象深刻,该模型在Kvasir-Capsule数据集上实现了97.75%的准确率,在Kvasirv2数据集上实现了98.81%的准确率。我们的解决方案表明,基础模型可以为胶囊内镜诊断巧妙地调整,表明仅依赖简单的微调或来自一般计算机视觉任务的预训练模型对于此类特定应用是不够的。
引用
@article{arxiv.2406.10508,
title = {Learning to Adapt Foundation Model DINOv2 for Capsule Endoscopy Diagnosis},
author = {Bowen Zhang and Ying Chen and Long Bai and Yan Zhao and Yuxiang Sun and Yixuan Yuan and Jianhua Zhang and Hongliang Ren},
journal= {arXiv preprint arXiv:2406.10508},
year = {2024}
}
备注
To appear in ICBIR 2024