给定基础模型时,如何确定所需的标注样本数量?—基于胸部X光分类的研究
计算机视觉与模式识别
2025-10-23 v2
摘要
胸部X光分类是医疗诊断中至关重要但资源密集的任务,通常需要大量标注数据才能实现准确诊断。基础模型(foundation model)有助于减轻对标注数据的依赖,但究竟需要多少个标注样本仍不明确。本文系统评估了利用幂律拟合(power-law fits)预测实现特定ROC-AUC阈值所需训练规模的方法。我们测试了多种病灶和基础模型,发现XrayCLIP和XraySigLIP的性能显著优于ResNet-50基线,所需标注样本数量大幅减少。重要的是,仅凭50个标注案例即可准确预测最终性能的平缓程度。我们的结果使实践者能够通过仅标注实现目标性能所必需的样本来最小化标注成本。
引用
@article{arxiv.2510.11553,
title = {How many samples to label for an application given a foundation model? Chest X-ray classification study},
author = {Nikolay Nechaev and Evgeniia Przhezdzetskaia and Viktor Gombolevskiy and Dmitry Umerenkov and Dmitry Dylov},
journal= {arXiv preprint arXiv:2510.11553},
year = {2025}
}
备注
8 pages, 5 figures