中文

基础模型与视觉Transformer模型特征融合用于皮肤图腮图像分类

计算机视觉与模式识别 2025-05-23 v1

摘要

准确分类皮肤图腮图像对于皮肤癌的诊断和治疗至关重要。本研究探讨了皮肤科特定基础模型PanDerm在皮肤图腮分类任务中相对于两种视觉Transformer (ViT) 架构 (ViT base 和 Swin Transformer V2 base) 的实用性。我们使用来自PanDerm的冻结特征,应用非线性探测,并使用三种不同的分类器,即多层感知器 (MLP)、XGBoost 和 TabNet。对于ViT-based模型,我们进行完整的微调以优化分类性能。我们在HAM10000和MSKCC数据集上的实验表明,基于PanDerm的MLP模型在准确率上与微调的Swin Transformer模型相当,而PanDerm和Swin Transformer预测的融合进一步提高了性能。未来的工作将探索更多基础模型、微调策略以及高级融合技术。

关键词

引用

@article{arxiv.2505.16338,
  title  = {Fusion of Foundation and Vision Transformer Model Features for Dermatoscopic Image Classification},
  author = {Amirreza Mahbod and Rupert Ecker and Ramona Woitek},
  journal= {arXiv preprint arXiv:2505.16338},
  year   = {2025}
}

备注

6 pages