中文

论防御对比学习后门攻击的困难性

密码学与安全 2023-12-15 v1 人工智能 计算机视觉与模式识别

摘要

最近的研究表明,对比学习与监督学习一样,极易受到后门攻击,其中恶意功能被注入目标模型,仅在特定触发器激活时生效。然而,迄今为止,对比后门攻击与监督后门攻击的根本区别仍未得到充分探索,这阻碍了针对这一新兴威胁的有效防御的发展。这项工作在回答这一关键问题上迈出了坚实的一步。具体来说,我们定义了TRL,一个统一框架,涵盖了监督和对比后门攻击。通过TRL的视角,我们发现两种攻击通过不同的机制运作:在监督攻击中,良性任务和后门任务的学习倾向于独立发生,而在对比攻击中,两个任务在表示和学习过程中都深度交织。这种区别导致了监督和对比攻击不同的学习动态和特征分布。更重要的是,我们揭示了对比后门攻击的特性从防御角度具有重要含义:现有的针对监督攻击的防御通常不足,并且不容易适用于对比攻击。我们还探索了几种替代防御措施,并讨论了它们的潜在挑战。我们的发现强调了需要针对对比后门攻击的特性量身定制的防御,为未来研究指明了有希望的方向。

关键词

引用

@article{arxiv.2312.09057,
  title  = {On the Difficulty of Defending Contrastive Learning against Backdoor Attacks},
  author = {Changjiang Li and Ren Pang and Bochuan Cao and Zhaohan Xi and Jinghui Chen and Shouling Ji and Ting Wang},
  journal= {arXiv preprint arXiv:2312.09057},
  year   = {2023}
}

备注

USENIX Security 24