深度学习模型的黑盒特洛伊化:利用非侵入式网络结构与二值篡改
密码学与安全
2020-08-05 v1 人工智能
机器学习
摘要
人工智能尤其是深度学习的最新进展提高了其在众多应用中的采用率。其中一些发挥着重要作用,以至于我们在生活中高度依赖它们。然而,与所有技术一样,存在恶意行为者可能利用的漏洞。一种利用方式是将这些旨在造福的技术转变为双重用途工具,以支持如恶意软件特洛伊等异常行为。作为主动防御的一部分,研究人员正主动识别此类漏洞,以便后续开发防护措施。本研究探索了一种新颖的黑盒特洛伊化方法,通过对任意深度学习图像分类模型进行简单的网络结构修改,并简单操纵权重以诱导特定类型的错误,从而将良性模型转变为异常模型。本研究讨论了防范此类简单漏洞利用的建议。本研究强调了为这些模型提供充分保障的重要性,以保护人工智能创新与采用的预期益处。
引用
@article{arxiv.2008.00408,
title = {Blackbox Trojanising of Deep Learning Models : Using non-intrusive network structure and binary alterations},
author = {Jonathan Pan},
journal= {arXiv preprint arXiv:2008.00408},
year = {2020}
}
备注
6 pages, 2 Figures