两颗头不输于一颗:Nested PoE 用于对抗多重后门
计算与语言
2024-04-04 v1
摘要
数据投毒后门攻击会导致大型语言模型(LLM) exhibit undesirable behaviors,抵御它们日益增长的重要性。现有的防御机制常常假设只有一种触发器被攻击者采用,而针对多个同时且独立的触发器类型的防御则需要通用防御框架且相对未被充分探索。本文提出了 Nested Product of Experts(NPoE)防御框架,其中包含一个作为触发器-only ensemble 的混合专家(MoE),置于 PoE 防御框架内,以同时防御多种触发器类型。在 NPoE 训练期间,主模型与一组学习后门触发器特征的较小专家模型组成的混合模型一起进行训练。在推理阶段,只使用主模型。在情感分析、仇恨言论检测和问题分类任务上的实验结果表明,NPoE 能有效防御各种触发器,包括触发器混合物。由于 MoE 结构在 NPoE 中的灵活性,该框架可以进一步扩展以防御其他攻击场景。
引用
@article{arxiv.2404.02356,
title = {Two Heads are Better than One: Nested PoE for Robust Defense Against Multi-Backdoors},
author = {Victoria Graf and Qin Liu and Muhao Chen},
journal= {arXiv preprint arXiv:2404.02356},
year = {2024}
}
备注
Accepted by NAACL 2024 Main Conference