中文

辩证对齐:化解 LLM 的 3H 张力与安全威胁

计算与语言 2024-04-02 v1 人工智能

摘要

随着大型语言模型 (LLM) 的兴起,确保它们体现有用、诚实和无害 (3H) 的原则(即人类对齐)变得至关重要。虽然现有的对齐方法(如 RLHF、DPO 等)能有效地微调 LLM 以匹配偏好数据集中的偏好,但它们通常会导致 LLM 高度接受人类输入和外部证据,即使这些信息被投毒。这导致当外部证据与其参数化记忆冲突时,LLM 倾向于成为“自适应变色龙”。这加剧了 LLM 受到外部投毒数据攻击的风险,对检索增强生成 (RAG) 等 LLM 系统应用构成了重大安全风险。为了应对这一挑战,我们提出了一个新颖的框架:辩证对齐 (DA),该框架 (1) 利用 AI 反馈来识别 LLM 在上下文窗口中具有不同外部证据(即不同比例的投毒事实上下文)时驾驭上下文间冲突和上下文-记忆冲突的最佳策略;(2) 基于上述 AI 反馈和策略构建 SFT 数据集以及偏好数据集;(3) 使用上述数据集进行 LLM 对齐,以防御投毒上下文攻击,同时保持上下文知识编辑的有效性。我们的实验表明,辩证对齐模型将投毒数据攻击防御提升了 20,并且不需要任何额外的提示工程或向 LLM 的上下文窗口预先声明“你可能受到攻击”。

关键词

引用

@article{arxiv.2404.00486,
  title  = {Dialectical Alignment: Resolving the Tension of 3H and Security Threats of LLMs},
  author = {Shu Yang and Jiayuan Su and Han Jiang and Mengdi Li and Keyuan Cheng and Muhammad Asif Ali and Lijie Hu and Di Wang},
  journal= {arXiv preprint arXiv:2404.00486},
  year   = {2024}
}