对抗攻击检测与对抗性攻击图像净化的学士论文报告
机器学习
2022-05-18 v1 密码学与安全
摘要
这是一份关于对抗性攻击图像检测与净化的学士论文报告。深度学习模型在特定训练样本上进行训练,以完成分类、回归等各种任务。通过训练调整权重,使模型不仅在训练样本上(由特定指标衡量)表现良好,而且具有出色的泛化能力,能在其他未见过的样本(通常称为测试数据)上也表现良好。尽管机器学习模型在广泛的任务中取得了巨大成功,但多年来安全性受到的关注却少得多。针对各种潜在网络攻击的鲁棒性也应成为衡量机器学习模型准确性的一个指标。这些网络攻击可能会对使用机器学习的现实世界敏感应用(如医疗和交通系统)产生各种负面影响。因此,保护系统免受此类攻击是必要的。在本报告中,我重点关注一类称为对抗攻击的网络攻击,在这种攻击中,原始输入样本被微小扰动修改,使其在人眼看来视觉上仍然相同,但机器学习模型却被此类输入所欺骗。在本报告中,我讨论了两种使用自编码器(AutoEncoders)对抗攻击的新方法:1)通过检测对抗样本的存在;2)净化这些对抗样本,使目标分类模型对此类攻击具有鲁棒性。
引用
@article{arxiv.2205.07859,
title = {Btech thesis report on adversarial attack detection and purification of adverserially attacked images},
author = {Dvij Kalaria},
journal= {arXiv preprint arXiv:2205.07859},
year = {2022}
}
备注
Btech thesis report of Dvij Kalaria, Indian Institute of Technology Kharagpur. arXiv admin note: substantial text overlap with arXiv:2111.15518; substantial text overlap with arXiv:1911.05268 by other authors