一位即足:将对抗样本理解为冗余的滥用
机器学习
2018-10-24 v1 密码学与安全
计算机视觉与模式识别
信息论
math.IT
机器学习
摘要
尽管机器学习(ML)取得了巨大成功,对抗样本已引发对其可信度的担忧:输入的微小扰动会导致原本看似训练良好的 ML 模型任意失效。虽然正在进行的研究旨在发现对抗样本的内在属性,如可迁移性和通用性,但缺乏足够的理论分析以有助于从能够影响 ML 实验设计过程的方式理解该现象。本文中,我们推导出一个信息论模型,将对抗攻击解释为 ML 算法中特征冗余的滥用。我们证明特征冗余是对抗样本存在的必要条件。我们的模型有助于解释许多关于对抗样本的轶事研究中提出的若干主要问题。我们的理论得到在图像和文本数据集上良性样本与对抗样本信息量的经验测量的支持。我们的测量表明,典型的对抗样本恰好引入足以溢出在相应良性样本上训练的 ML 模型决策的冗余。我们以改进机器学习器抵御对抗样本鲁棒性的可操作建议作结。
引用
@article{arxiv.1810.09650,
title = {One Bit Matters: Understanding Adversarial Examples as the Abuse of Redundancy},
author = {Jingkang Wang and Ruoxi Jia and Gerald Friedland and Bo Li and Costas Spanos},
journal= {arXiv preprint arXiv:1810.09650},
year = {2018}
}