对齐增强解码:通过概率分布的逐词自适应精化进行防御
计算与语言
2024-12-20 v2 人工智能
摘要
大语言模型容易受到越狱攻击,从而导致有害内容的生成。虽然先前的防御方法通过扰动或检查输入来缓解这些风险,但它们忽略了竞争性目标——即对齐失败的根本原因。在本文中,我们提出了对齐增强解码(AED),一种利用自适应解码来解决越狱问题根源的新型防御方法。我们首先定义了竞争指数来量化对齐失败,并利用自评估的反馈来计算对齐后逻辑值。然后,AED 自适应地将对齐后逻辑值与原始逻辑值进行组合,以获得无害且有帮助的分布。因此,我们的方法在增强安全对齐的同时保持了有用性。我们在五个模型和四种常见越狱攻击上进行了实验,结果验证了我们方法的有效性。代码可在 https://github.com/GIGABaozi/AED.git 获取。
引用
@article{arxiv.2408.07663,
title = {Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions},
author = {Quan Liu and Zhenhong Zhou and Longzhu He and Yi Liu and Wei Zhang and Sen Su},
journal= {arXiv preprint arXiv:2408.07663},
year = {2024}
}
备注
Accepted by EMNLP 2024, 15 pages, 5 figures