长尾医学数据集的开放集无监督学习
计算机视觉与模式识别
2025-05-22 v1
摘要
许多实际医学成像场景包括 被低表示但仍至关重要的类别。图像识别模型的现实应用价值在于其能够对这些稀有类别以及未见类别进行泛化。现实世界的泛化能力需要考虑实际情境中可能遇到的各种复杂性。首先,训练数据高度不平衡,可能导致模型偏向于更频繁表示的类别。此外,现实数据可能包含需要识别的未见类别,模型性能受数据稀缺性影响。尽管医学图像识别在文献中已得到广泛关注,但当前方法未能考虑所有实际情境的细节。为此,我们提出一种用于高度不平衡医学数据集的开放集学习方法,采用无监督方法。理解长尾分布对模型固有特征的不利影响,我们在特征层面实施正则化策略,辅以分类器归一化技术。我们在公开数据集 ISIC2018、ISIC2019 和 TissueMNIST 上进行了大量实验,测试各种数量的标记样本。我们的分析表明,解决长尾数据对分类的影响在所有数据集的封闭集和开放集准确性方面均显著提高了网络整体性能。我们的代码和训练好的模型将在 https://github.com/Daniyanaj/OpenLTR 上公开。
引用
@article{arxiv.2505.14846,
title = {Open-Set Semi-Supervised Learning for Long-Tailed Medical Datasets},
author = {Daniya Najiha A. Kareem and Jean Lahoud and Mustansar Fiaz and Amandeep Kumar and Hisham Cholakkal},
journal= {arXiv preprint arXiv:2505.14846},
year = {2025}
}