ParaFuzz:一种基于可解释性驱动检测 NLP 中毒样本的技术
密码学与安全
2023-10-30 v2 计算与语言
摘要
后门攻击已成为自然语言处理(NLP)模型的显著威胁,输入中特定触发器的存在可使中毒模型将这些输入误分类至预定目标类。当前的检测机制受限于无法应对更隐蔽的后门策略,如基于风格的攻击。本工作中,我们提出一种创新的测试时中毒样本检测框架,其立足于模型预测的可解释性,并基于输入的语义含义。我们认为触发器(如低频词)本不应根本改变中毒样本的底层语义,因为它们意图保持隐蔽。基于此观察,我们假设:改写后的干净样本模型预测应保持稳定,而中毒样本的预测在改写过程中对触发器进行变异后应恢复其真实标签。我们采用 ChatGPT(一个 SOTA 大语言模型)作为改写器,并将触发器移除任务形式化为提示工程问题。我们采用模糊测试(fuzzing,一种常用于发掘软件漏洞的技术)来发现最优改写提示,在有效消除触发器的同时保持输入语义。在 4 类后门攻击(含细微风格后门)与 4 个不同数据集上的实验表明,我们的方法在精确率与召回率上超越了包括 STRIP、RAP 和 ONION 在内的基线方法。
引用
@article{arxiv.2308.02122,
title = {ParaFuzz: An Interpretability-Driven Technique for Detecting Poisoned Samples in NLP},
author = {Lu Yan and Zhuo Zhang and Guanhong Tao and Kaiyuan Zhang and Xuan Chen and Guangyu Shen and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2308.02122},
year = {2023}
}