模拟与消除:面向生成式大语言模型的后门撤回
摘要
随着快速进步,生成式大语言模型(Generative Large Language Models, LLMs)在从理解到推理的各种自然语言处理(Natural Language Processing, NLP)任务中占据主导地位。然而,语言模型固有的脆弱性可能因更高的可访问性以及在大规模数据上的无限制训练而加剧。恶意对手可能在线上发布中毒数据,并对基于中毒数据预训练的受害 LLMs 实施后门攻击。后门型 LLMs 对正常查询表现得很温和,仅在触发后门触发器时生成有害响应。尽管付出了大量努力来解决 LLMs 的安全问题,但 LLMs 仍在后门攻击面前束手无策。正如 Anthropic 最近披露的那样,现有的安全训练策略,包括监督微调(Supervised Fine-tuning, SFT)和基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF),在 LLMs 完成预训练阶段后门化后,无法撤回后门。本文提出 Simulate and Eliminate(SANDE)以消除生成式 LLMs 中不必要的后门映射。我们最初提出覆盖式监督微调(Overwrite Supervised Fine-tuning, OSFT)以在触发器已知时有效撤回后门。随后,为了处理触发器模式未知的场景,我们将 OSFT 集成到我们的两个阶段框架中。与其他假设可获取干净训练模型的工作不同,我们的安全强化 LLMs 能够在无需任何参考数据的情况下撤回后门。因此,我们的安全强化 LLMs 在后门触发器被激活时,不再生成定向响应。我们进行了全面实验,表明我们提出的 SANDE 在撤回后门攻击方面有效,同时对 LLMs 的强大能力影响甚微。
引用
@article{arxiv.2405.07667,
title = {Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models},
author = {Haoran Li and Yulin Chen and Zihao Zheng and Qi Hu and Chunkit Chan and Heshan Liu and Yangqiu Song},
journal= {arXiv preprint arXiv:2405.07667},
year = {2024}
}
备注
To appear at AAAI 2025