中文

通过不确定性驱动扰动改善泛化能力

机器学习 2022-03-02 v2

摘要

近期 Shah 等人(2020)指出了简单性偏差的缺陷——基于梯度的算法倾向于学习简单模型的趋势——包括模型对小输入扰动的高敏感性以及次优间隔。特别地,尽管随机梯度下降在线性模型上产生最大间隔边界,此类保证并不扩展到非线性模型。为缓解简单性偏差,我们考虑对训练数据点进行不确定性驱动扰动(UDP),通过迭代地沿最大化模型估计不确定性的方向施加。该不确定性估计不依赖输入标签,且在决策边界处最高,并且——不同于损失驱动扰动——它允许使用更大范围的扰动幅度值。此外,由于真实世界数据集不同类数据点间具有非各向同性距离,上述特性对于增大决策边界间隔尤为可取,进而改善模型泛化。我们证明 UDP 在线性模型上保证达到最大间隔决策边界,并在具挑战性的模拟数据集上显著增大该间隔。对于非线性模型,我们从经验上表明 UDP 降低了简单性偏差并学习了更详尽的特征。有趣的是,它还在多个数据集上实现了具有竞争力的基于损失的鲁棒性与泛化权衡。

关键词

引用

@article{arxiv.2202.05737,
  title  = {Improving Generalization via Uncertainty Driven Perturbations},
  author = {Matteo Pagliardini and Gilberto Manunza and Martin Jaggi and Michael I. Jordan and Tatjana Chavdarova},
  journal= {arXiv preprint arXiv:2202.05737},
  year   = {2022}
}