中文

反事实样本是否使对抗训练复杂化?

机器学习 2024-04-18 v2 计算机视觉与模式识别

摘要

我们利用扩散模型来研究鲁棒分类器的鲁棒性-性能权衡。我们的方法引入了一种简单的预训练扩散方法,用于生成低范数反事实样本(CEs):语义改变的数据,导致不同的真实类别归属。我们报告了鲁棒模型在其干净训练数据上的置信度和准确性与数据与其CEs的接近程度相关。此外,当直接在CEs上评估时,鲁棒模型表现非常差,因为它们对CEs带来的低范数语义变化变得越来越不变。结果表明,非鲁棒特征与语义特征之间存在显著重叠,这与非鲁棒特征不可解释的常见假设相悖。

关键词

引用

@article{arxiv.2404.10588,
  title  = {Do Counterfactual Examples Complicate Adversarial Training?},
  author = {Eric Yeats and Cameron Darwin and Eduardo Ortega and Frank Liu and Hai Li},
  journal= {arXiv preprint arXiv:2404.10588},
  year   = {2024}
}

备注

Accepted as a short paper to the GCV Workshop at CVPR'24