中文

利用数据对称性在标签噪声下选择最优训练数据子集

机器学习 2026-05-05 v1 人工智能

摘要

机器学习模型的性能往往依赖于大规模标记数据集,但来自不同来源的数据集可能包含标签噪声。最近的研究表明,在噪声环境中,可能存在训练数据的一个子集,可实现与在无噪声数据集上训练相当的性能。用于识别此类子集的方法之一是cutstats,采用k近邻(k-NN)检测低噪声样本。然而,其在高维数据上的表现尚未得到充分探索。本文正式建立了在标签噪声环境下,通过cutstats选择的训练数据子集上训练的分类器性能受k-NN准确度的影响。我们进一步演示,在噪声环境中,利用数据不变性和底层对称性知识可以显著提高k-NN的性能,使其更接近贝叶斯最优分类器,即使在高维情节下也是如此。最后,我们表明在实际场景中,由于对底层不变性信息仅部分已知,学习到的不变表示仍可促进近似最优子集的识别。

关键词

引用

@article{arxiv.2605.01874,
  title  = {Leveraging Data Symmetries to Select an Optimal Subset of Training Data under Label Noise},
  author = {Kumar Shubham and Pavan Karjol and Kiran M K and Prathosh AP},
  journal= {arXiv preprint arXiv:2605.01874},
  year   = {2026}
}