中文

探究困难样本对准确率的影响揭示类内数据不平衡

机器学习 2024-09-24 v1

摘要

在 AutoML 领域,测试准确率被视为评估模型效能的典型指标,支撑着从神经架构搜索到超参数优化等一系列广泛应用。然而,测试准确率作为主要性能指标的可靠性受到了质疑,特别是通过强调标签噪声如何掩盖最先进模型真实排名的研究。我们沿着另一视角进一步探索,即数据集中困难样本的存在使仅从测试准确率推断出的泛化能力受到进一步质疑。我们的研究表明,训练集和测试集之间困难样本的分布影响了这些数据集的难度水平,从而影响了模型感知到的泛化能力。我们揭示了两种不同的泛化路径——趋向于简单样本和困难样本——突显了实现均衡模型评估的复杂性。最后,我们提出了一种用于比较困难样本识别方法的基准测试流程,促进了该领域更细致方法的发展。我们的主要目标不是提出一个确定的解决方案,而是通过引入类内数据不平衡问题,强调即使在处理均衡数据集时,主要依赖测试准确率作为评估指标的局限性。通过这样做,我们旨在激发研究界内的批判性讨论,并为考虑更广泛模型评估标准的研究开辟新途径。匿名代码可在 https://github.com/PawPuk/CurvBIM blueunder 的 GPL-3.0 许可证下获取。

关键词

引用

@article{arxiv.2409.14401,
  title  = {Investigating the Impact of Hard Samples on Accuracy Reveals In-class Data Imbalance},
  author = {Pawel Pukowski and Haiping Lu},
  journal= {arXiv preprint arXiv:2409.14401},
  year   = {2024}
}

备注

Accepted to workshop track of AutoML'24 (see openreview)