中文

面向多轮对话的安全推理引导对齐

计算与语言 2025-06-03 v1

摘要

恶意攻击者可通过与大型语言模型(LLM)进行多轮对话来利用它们以实现有害目标,从而对社会造成重大安全风险。为应对这一挑战,我们提出了一种新颖的防御机制:面向多轮对话的安全推理引导对齐(STREAM)。STREAM 在保持 LLM 功能能力的同时,防御其免受多轮攻击。我们的方法涉及构建一个人工标注的数据集,即安全推理多轮对话数据集,用于微调一个即插即用的安全推理审查器。该模型旨在识别隐藏在多轮对话中的恶意意图,并提醒目标 LLM 潜在的风险。我们在多个 LLM 上针对流行的多轮攻击策略评估了 STREAM。实验结果表明,我们的方法显著优于现有防御技术,将攻击成功率(ASR)降低了 51.2%,同时保持了相当的 LLM 能力。

关键词

引用

@article{arxiv.2506.00668,
  title  = {SafeTy Reasoning Elicitation Alignment for Multi-Turn Dialogues},
  author = {Martin Kuo and Jianyi Zhang and Aolin Ding and Louis DiValentin and Amin Hass and Benjamin F Morris and Isaac Jacobson and Randolph Linderman and James Kiessling and Nicolas Ramos and Bhavna Gopal and Maziyar Baran Pouyan and Changwei Liu and Hai Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2506.00668},
  year   = {2025}
}