剖析样本难度:以数据为中心的 AI 中难度表征方法的细粒度分析
机器学习
2024-03-08 v1
摘要
表征难以学习的样本对于开发高性能的机器学习模型至关重要。这促使了许多旨在识别“困难”样本的难度表征方法(HCMs)的出现。然而,关于“难度”的定义和评估缺乏共识。遗憾的是,当前的 HCMs 仅在特定类型的难度上进行了评估,且通常只是定性评估或针对下游性能进行评估,忽略了基础的定量识别任务。我们通过提出一种细粒度的难度类型分类法来填补这一空白。此外,我们提出了难度表征分析工具包(H-CAT),它支持在难度分类法中对 HCMs 进行全面和定量的基准测试,并且可以轻松扩展到新的 HCMs、难度类型和数据集。我们使用 H-CAT 评估了 8 种难度类型下的 13 种不同 HCMs。这项涵盖超过 14K 种设置的综合评估揭示了不同 HCMs 的优缺点,从而为指导 HCM 选择和未来开发提供了实用技巧。我们的发现强调了对 HCM 进行更全面评估的需求,同时我们希望我们的难度分类法和工具包将推进以数据为中心的 AI 方法的原则性评估和采纳。
关键词
引用
@article{arxiv.2403.04551,
title = {Dissecting Sample Hardness: A Fine-Grained Analysis of Hardness Characterization Methods for Data-Centric AI},
author = {Nabeel Seedat and Fergus Imrie and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2403.04551},
year = {2024}
}
备注
Published at International Conference on Learning Representations (ICLR) 2024