类特征自编码器用于衡量分类难度并检测标签错误
机器学习
2024-12-04 v1 计算机视觉与模式识别
摘要
我们提出了一种基于在各个类别上训练的自编码器重构误差比率来分析分类数据集的新框架。这种分析框架可高效地在样本、类别和整个数据集三个层面上对数据集进行特征化。我们定义重构误差比率(RER),以探测分类难度并将其分解为:(1) 有限样本量和 (2) 贝叶斯误差及决策边界复杂度。通过对 19 个流行视觉数据集的系统性研究,我们发现我们的 RER 基方法在与最先进(SOTA)分类模型相关联的错误率上表现出强烈相关性。通过将样本级分类难度解释为标签错误得分,我们进一步发现 RER 在对称标签噪声和非对称标签噪声条件下的困难数据集上的误标签检测任务中实现了 SOTA 性能。我们的代码已公开于 https://github.com/voxel51/reconstruction-error-ratios。
引用
@article{arxiv.2412.02596,
title = {Class-wise Autoencoders Measure Classification Difficulty And Detect Label Mistakes},
author = {Jacob Marks and Brent A. Griffin and Jason J. Corso},
journal= {arXiv preprint arXiv:2412.02596},
year = {2024}
}
备注
30 pages, 18 figures