数据防御:数据策展在定制化LLM以对抗越狱攻击中的作用
密码学与安全
2025-02-19 v4 人工智能
摘要
大型语言模型(LLMs)通过微调广泛用于下游应用,称为定制化过程。然而,近期研究识别出了这种过程中的一个漏洞,即恶意样本可能会损害LLM的鲁棒性并放大有害行为——这种攻击常被称为越狱攻击。为应对这一挑战,我们提出了一种自适应数据策展方法,允许将任何文本策展以增强其在定制化过程中抵抗恶意样本的效果。为避免需要额外防御模块,我们进一步引入了一个覆盖定制化生命周期的综合缓解框架:在定制化之前用于免疫LLM免受未来越狱尝试的攻击,在定制化过程中中和风险,在定制化之后恢复受损模型。实验结果显示,越狱效应显著降低,安全响应生成成功率达到100%。通过将自适应数据策展与生命周期基于的缓解策略相结合,本工作在缓解越狱风险并确保LLM安全适配方面迈出了坚实的一步。
引用
@article{arxiv.2410.02220,
title = {Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks},
author = {Xiaoqun Liu and Jiacheng Liang and Luoxi Tang and Muchao Ye and Weicheng Ma and Zhaohan Xi},
journal= {arXiv preprint arXiv:2410.02220},
year = {2025}
}