重学再学习后门:深度学习模型的延迟后门功能攻击
密码学与安全
2024-11-26 v2 人工智能
机器学习
摘要
深度学习模型对后门攻击高度脆弱,这类攻击在训练期间植入恶意功能,在推理时会在触发输入上激活。广泛的研究聚焦于开发隐蔽的后门攻击以规避检测和防御机制。然而,这些方法仍存在局限,使得后门攻击仍可能被检测和缓解,由于其本质设计旨在在触发条件存在时引发恶意行为。为此,我们引入了延迟激活后门功能(DABF)这一新范式。与常规攻击不同,DABF在初始阶段会隐藏其后门,即使在触发输入下也会产生正常输出。这种隐蔽行为使DABF能够规避多种检测和防御方法,在初始检查期间保持 undetected。后门功能仅在模型随后进行更新(例如在良好数据上重新训练)后才会被策略性激活。DABF攻击利用了在机器学习模型生命周期中进行模型更新和微调的常见做法。为实现DABF攻击,我们通过使后门的“忘卸”过程脆弱,使其易于取消并随后重新激活后门功能。为此,我们提出了一种新的两阶段训练方案,即DeferBad。我们在各种微调场景、后门攻击类型、数据集和模型架构上进行了大量实验,证明了DeferBad的有效性和隐蔽性。
引用
@article{arxiv.2411.14449,
title = {Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models},
author = {Jeongjin Shin and Sangdon Park},
journal= {arXiv preprint arXiv:2411.14449},
year = {2024}
}