中文

我的分类器性能上限是多少?基于类别相关影响函数的帕累托前沿分析

机器学习 2025-10-07 v1

摘要

数据中心学习旨在从数据质量角度提升模型性能,近年来在机器学习社区受到广泛关注。在其关键工具中,影响函数提供了强大的框架来量化单个训练样本对模型预测的影响,使实践者能够识别有害样本并在更干净的数据集上重新训练模型以提升性能。然而,现有工作主要聚焦于“哪些数据有助于学习模型?”本文进一步探讨更根本的问题:“学习模型的性能上限是多少?”不同于以往以整体准确率为主要衡量标准,本文强调类别准确率,追求帕累托改进,确保每个类别都受益,而非某些类别提升而牺牲其他类别。为此,我们提出类别相关影响函数,构建影响向量量化每个训练样本在所有类别中的影响。利用这些影响向量,我们设计原则性准则判断模型是否仍可提升,并构建基于线性规划的样本重加权框架以实现帕累托性能提升。通过在合成数据集、视觉和文本基准上的大量实验,我们展示了该方法在估计和实现多个感兴趣类别的模型性能提升方面的有效性。

关键词

引用

@article{arxiv.2510.03950,
  title  = {What Is The Performance Ceiling of My Classifier? Utilizing Category-Wise Influence Functions for Pareto Frontier Analysis},
  author = {Shahriar Kabir Nahin and Wenxiao Xiao and Joshua Liu and Anshuman Chhabra and Hongfu Liu},
  journal= {arXiv preprint arXiv:2510.03950},
  year   = {2025}
}