对抗性文本净化:一种用于防御的大语言模型方法
密码学与安全
2024-02-13 v1 人工智能
计算与语言
机器学习
摘要
对抗性净化是一种防御机制,旨在在不知道攻击类型或分类器训练情况的前提下,保护分类器免受对抗性攻击。这些技术表征并消除受攻击输入中的对抗性扰动,旨在恢复净化后的样本,使其与最初受攻击的样本保持相似性,并能被分类器正确分类。由于表征离散输入噪声扰动的固有挑战,对抗性文本净化尚未得到充分探索。在本文中,我们研究了对抗性净化方法在防御文本分类器方面的有效性。我们提出了一种新颖的对抗性文本净化方法,利用大语言模型 (LLMs) 的生成能力来净化对抗性文本,而无需显式地表征离散噪声扰动。我们利用提示工程 (prompt engineering) 利用 LLMs 恢复给定对抗样本的净化样本,使其在语义上相似且能被正确分类。我们提出的方法在各种分类器上表现出卓越的性能,平均将受攻击下的准确率提高了 65% 以上。
引用
@article{arxiv.2402.06655,
title = {Adversarial Text Purification: A Large Language Model Approach for Defense},
author = {Raha Moraffah and Shubh Khandelwal and Amrita Bhattacharjee and Huan Liu},
journal= {arXiv preprint arXiv:2402.06655},
year = {2024}
}
备注
PAKDD 2024