从捷径到触发器:基于去噪 PoE 的后门防御
计算与语言
2024-04-04 v3 人工智能
密码学与安全
机器学习
摘要
语言模型常面临多样后门攻击的风险,尤其是数据投毒。因此,研究应对这些问题的防御方案十分重要。现有后门防御方法主要关注具有显式触发器的后门攻击,针对具有多样触发器的各类后门攻击的通用防御仍很大程度上未被探索。本文中,我们提出一种端到端的基于集成的后门防御框架 DPoE(Denoised Product-of-Experts),其受后门攻击捷径本质的启发,用以防御各类后门攻击。DPoE 由两个模型组成:一个捕获后门捷径的浅层模型,以及一个被阻止学习后门捷径的主模型。为解决后门攻击者导致的标签翻转,DPoE 引入了去噪设计。在 SST-2 数据集上的实验表明,DPoE 显著提升了针对包括词级、句级和句法触发器在内的各类后门触发器的防御性能。此外,DPoE 在混合多种触发器类型这一更具挑战性但更实际的设定下同样有效。
引用
@article{arxiv.2305.14910,
title = {From Shortcuts to Triggers: Backdoor Defense with Denoised PoE},
author = {Qin Liu and Fei Wang and Chaowei Xiao and Muhao Chen},
journal= {arXiv preprint arXiv:2305.14910},
year = {2024}
}
备注
Accepted by NAACL 2024 Main Conference