良性对抗攻击:以巧计利用模型为善
人工智能
2022-07-06 v2 计算机视觉与模式识别
摘要
尽管机器学习模型在许多领域获得成功应用,当今仍深受对抗样本脆弱性等恶名昭彰的问题所困。本文超越对抗攻击与防御间猫鼠游戏的窠臼,提供另一种视角审视对抗样本,并探讨能否将其用于良性应用。我们首先将对抗样本归因于人与模型在利用非语义特征上的差异。非语义特征在经典机器学习机制中多被忽视,却具三项有趣特性:(1)为模型独有,(2)对影响推理至关重要,(3)可作为特征使用。受此启发,我们提出良性对抗攻击这一崭新思路,从三个方向利用对抗样本为善:(1)对抗图灵测试,(2)拒斥恶意模型应用,(3)对抗数据增强。各方向均辅以动机阐述、合理性分析与原型应用以展示其潜力。
引用
@article{arxiv.2107.11986,
title = {Benign Adversarial Attack: Tricking Models for Goodness},
author = {Jitao Sang and Xian Zhao and Jiaming Zhang and Zhiyu Lin},
journal= {arXiv preprint arXiv:2107.11986},
year = {2022}
}
备注
ACM MM2022 Brave New Idea