在机器学习模型中植入不可检测后门
机器学习
2024-11-12 v2 密码学与安全
摘要
鉴于训练机器学习模型所需的计算成本和技术专长,用户可能将学习任务委托给服务提供商。我们展示恶意学习器如何向分类器中植入不可检测的后门。表面上看,此类后门分类器表现正常,但实际上学习器维持着一种仅需轻微扰动即可改变任何输入分类的机制。重要的是,若无适当的“后门密钥”,该机制是隐藏的,且任何计算有界观察者都无法检测。我们展示了两种具有不可比保证的植入不可检测后门框架。首先,我们展示如何利用数字签名方案在任何模型中植入后门。该构造保证,给定对原始模型和后门版本的黑盒访问,计算上不可能找到哪怕一个它们不同的输入。此性质意味着后门模型的泛化误差与原始模型相当。其次,我们展示如何在采用随机傅里叶特征(RFF)学习范式训练的模型或随机ReLU网络中插入不可检测后门。在此构造中,不可检测性对强大的白盒区分器成立:给定网络完整描述和训练数据,任何高效区分器都无法猜测模型是“干净”的还是含后门。我们不可检测后门的构造也阐明了对抗样本鲁棒性的相关问题。特别地,我们的构造可生成与“对抗鲁棒”分类器不可区分的分类器,但其中每个输入都存在对抗样本!总之,不可检测后门的存在构成了证明对抗鲁棒性的重大理论障碍。
引用
@article{arxiv.2204.06974,
title = {Planting Undetectable Backdoors in Machine Learning Models},
author = {Shafi Goldwasser and Michael P. Kim and Vinod Vaikuntanathan and Or Zamir},
journal= {arXiv preprint arXiv:2204.06974},
year = {2024}
}