基于 CLIP 条件的扩散 Transformer 域自适应皮肤瘤分类
计算机视觉与模式识别
2025-05-23 v1 人工智能
图像与视频处理
摘要
探索深度学习模型的可信度在关键领域(如医学影像决策支持系统)尤为重要。然而, conformal 预测结果面临挑战,由于基础模型在域偏移场景(例如来自不同来源的差异)中难以稳健工作。为此目的,本文提出了一种新框架,称为 Conformal Ensemble of Vision Transformers (CE-ViTs),旨在通过优先考虑域适应和模型鲁棒性,同时考虑不确定性,来增强图像分类性能。该方法利用来自 HAM10000、Dermofit 和 Skin Cancer ISIC 数据集的多个视觉转换器模型组成的集成。该集成学习方法通过校准组合后的数据集来实现,以实现域适应。实验结果表明,该框架实现了 90.38% 的高覆盖率,较 HAM10000 模型提升了 9.95%。这表明预测集合包含真实标签的可能性显著高于单个模型。CE-ViTs 中的集成学习显著改善了 conformal 预测性能,将具有挑战性的误分类样本的平均预测集大小从 1.86 增加到 3.075。
引用
@article{arxiv.2505.15997,
title = {Domain Adaptive Skin Lesion Classification via Conformal Ensemble of Vision Transformers},
author = {Mehran Zoravar and Shadi Alijani and Homayoun Najjaran},
journal= {arXiv preprint arXiv:2505.15997},
year = {2025}
}
备注
5 pages, 4 figures, conference (ccece 2025)