中文

既有此类假友,谁还能察觉错误?

机器学习 2021-12-14 v3 密码学与安全

摘要

由显式对手精心制作的对抗样本在机器学习中引起了显著关注。然而,潜在假朋友所带来的安全风险在很大程度上被忽视了。在本文中,我们揭示了虚伪样本——即原本被错误分类但经假朋友扰动以强制产生正确预测的输入——的威胁。虽然此类被扰动的样本看似无害,我们首次指出它们可能被恶意用于在评估期间掩盖不达标(即不如所需般好)模型的错误。一旦部署者信任这种虚伪的性能并将该“表现良好”的模型应用于实际场景,即使在良性环境中也可能发生意想不到的失败。更严重的是,这一安全风险似乎是普遍存在的:我们发现多种类型的不达标模型在多个数据集上都易受虚伪样本攻击。此外,我们首次尝试用称为虚伪风险(hypocritical risk)的度量来刻画该威胁,并试图通过几种对策来规避它。结果表明了对策的有效性,但即使在自适应鲁棒训练后该风险仍不可忽略。

关键词

引用

@article{arxiv.2012.14738,
  title  = {With False Friends Like These, Who Can Notice Mistakes?},
  author = {Lue Tao and Lei Feng and Jinfeng Yi and Songcan Chen},
  journal= {arXiv preprint arXiv:2012.14738},
  year   = {2021}
}

备注

AAAI 2022