中文

UnbiasedNets:一种用于缓解神经网络鲁棒性偏差的数据集多样化框架

机器学习 2023-03-14 v2

摘要

近年来,尤其在深度学习出现后,训练好的神经网络(NN)模型在测试准确率方面的性能有了显著提升。然而,即便最精确的 NN 也会因可用训练数据集中固有的偏差而偏向特定输出分类,这种偏差可能延续到实际部署中。本文研究鲁棒性偏差,即训练好的 NN 对某一输出类的噪声鲁棒性远高于其余输出类所表现出的偏差。该偏差被证明源于不平衡数据集,即各类输出表征不均的数据集。为此,我们提出 UnbiasedNets 框架,其利用 K-means 聚类与 NN 的噪声容忍度来使给定训练数据集多样化,即便数据集相对较小。这生成了平衡数据集并降低了数据集自身的偏差。据我们所知,这是首个针对 NN 中鲁棒性偏差问题的框架。我们使用真实世界数据集在二分类与多标签分类器下证明了 UnbiasedNets 用于数据多样化的有效性。结果相较于旨在生成平衡数据集的知名工具,并阐明已有工作在解决鲁棒性偏差上成功有限。相比之下,UnbiasedNets 相较已有工作有显著提升,且在某些情况下如比较基于多样化与原始数据集训练的 NN 所见,甚至显著降低了鲁棒性偏差。

关键词

引用

@article{arxiv.2302.12538,
  title  = {UnbiasedNets: A Dataset Diversification Framework for Robustness Bias Alleviation in Neural Networks},
  author = {Mahum Naseer and Bharath Srinivas Prabakaran and Osman Hasan and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2302.12538},
  year   = {2023}
}

备注

Springer Machine Learning 2023