中文

通过对抗鲁棒性与校准的关系改进校准

机器学习 2021-12-15 v2 机器学习

摘要

神经网络缺乏对抗鲁棒性,即它们易受对抗样本的攻击,这些样本通过对输入施加微小扰动导致错误预测。此外,当模型给出未校准的预测时,信任会受到损害,即预测概率并不能很好地指示我们应多大程度上信任模型。在本文中,我们研究对抗鲁棒性与校准之间的联系,发现对微小扰动敏感(易被攻击)的输入更可能具有校准不良的预测。基于这一见解,我们考察是否可以通过处理那些对抗非鲁棒输入来改进校准。为此,我们提出基于对抗鲁棒性的自适应标签平滑(AR-AdaLS),该方法通过将对抗鲁棒性与校准的相关性整合到训练中,根据样本被对手攻击的难易程度自适应地软化其标签。我们发现,我们的方法考虑到分布内数据的对抗鲁棒性,即使在分布偏移下也能使模型获得更好的校准。此外,AR-AdaLS 也可应用于集成模型以进一步改进模型校准。

关键词

引用

@article{arxiv.2006.16375,
  title  = {Improving Calibration through the Relationship with Adversarial Robustness},
  author = {Yao Qin and Xuezhi Wang and Alex Beutel and Ed H. Chi},
  journal= {arXiv preprint arXiv:2006.16375},
  year   = {2021}
}

备注

Published at NeurIPS-2021