超越大小与类别平衡:Alpha 作为深度学习新的数据集质量指标
计算机视觉与模式识别
2024-08-02 v2 机器学习
摘要
在深度学习中,实现图像分类任务的高性能需要多样化的训练集。然而,当前的最佳实践——最大化数据集大小和类别平衡——并不一定保证数据集的多样性。我们假设,对于给定的模型架构,通过更直接地最大化多样性可以提高模型性能。为检验这一假设,我们引入了一个从生态学中提取的综合多样性测度框架,将熟悉的量量如 Shannon 熵等 generalizations,纳入对图像之间相似性的考虑。(大小和类别平衡可视为特殊情况。)分析了来自七个医学数据集的大量子集后发现,最佳的性能相关因素并非数据集大小或类别平衡,而是 -“big alpha”——一组accounting for 图像相似性后的广义熵测度,解释为在考虑图像相似性后的数据集中图像-类别对的有效数量。其中一种测度 对于平衡准确率的解释比例达到 67%,而类别平衡为 54%,仅为 39%。最佳的测度组合为大小加上 (79%),超过了大小加上类别平衡(74%)。具有最大 的子集在中性水平上比具有最大大小的子集表现出高达 16%的优势。我们提出将 作为提高医学影像深度学习性能的新方法。
引用
@article{arxiv.2407.15724,
title = {Beyond Size and Class Balance: Alpha as a New Dataset Quality Metric for Deep Learning},
author = {Josiah Couch and Rima Arnaout and Ramy Arnaout},
journal= {arXiv preprint arXiv:2407.15724},
year = {2024}
}
备注
11 pages, 5 figures, 3 tables