中文

基于点互信息检测误标记和损坏数据

机器学习 2025-08-12 v1 机器学习

摘要

深度神经网络能够记忆损坏的标签,使得数据质量对模型性能至关重要,但实际数据集常常同时受到标签噪声和输入噪声的破坏。本文提出一种基于互信息的数据选择框架,用于处理混合噪声情景,通过量化输入与标签之间的统计依赖性。我们计算每个样本对总体互信息的点贡献,发现较低的贡献值指示该实例存在噪声或标签错误。在不同合成噪声设置下对 MNIST 进行实验验证,表明该方法能够有效过滤低质量样本。在标签损坏情况下,仅使用高互信息样本训练的模型,其分类准确率相较于随机抽样可提升最高达 15%。此外,该方法对惩罚性输入修改具有鲁棒性,能够保留语义上有效的数据,同时过滤真正损坏的样本。

关键词

引用

@article{arxiv.2508.07713,
  title  = {Detecting Mislabeled and Corrupted Data via Pointwise Mutual Information},
  author = {Jinghan Yang and Jiayu Weng},
  journal= {arXiv preprint arXiv:2508.07713},
  year   = {2025}
}

备注

Under Working