中文

迈向 LLM 的安全推理:基于 AI 智能体审议的策略嵌入 CoT 数据创建

人工智能 2025-05-29 v1 计算与语言

摘要

安全推理是一种新范式,LLM 在生成响应前先对安全策略进行推理,从而缓解现有安全措施的局限性,如过度拒绝和越狱漏洞。然而,实施这一范式具有挑战性,因为创建高质量的策略嵌入思维链 (CoT) 数据集是一个资源密集型的过程,同时还需确保推理准确且无幻觉或策略冲突。为解决此问题,我们提出了 AIDSAFE:用于安全推理的智能体迭代审议,这是一种新颖的数据生成方案,利用多智能体审议来迭代扩展对安全策略的推理。AIDSAFE 中的数据精炼阶段通过消除重复、冗余和欺骗性的思维来确保高质量输出。AIDSAFE 生成的 CoT 为基于监督微调 (SFT) 的安全训练提供了坚实基础。此外,为了满足对齐阶段(如 DPO 训练)对偏好数据的需求,我们引入了一种补充方案,利用信念增强来创建不同的选中与拒绝 CoT 样本。我们的评估表明,AIDSAFE 生成的 CoT 实现了卓越的策略遵循度和推理质量。因此,我们证明了在这些 CoT 上微调开源 LLM 可以显著提高安全泛化能力和越狱鲁棒性,同时保持可接受的实用性和过度拒绝准确率。AIDSAFE 生成的 CoT 数据集可在此处找到:https://huggingface.co/datasets/AmazonScience/AIDSAFE

关键词

引用

@article{arxiv.2505.21784,
  title  = {Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation},
  author = {Tharindu Kumarage and Ninareh Mehrabi and Anil Ramakrishna and Xinyan Zhao and Richard Zemel and Kai-Wei Chang and Aram Galstyan and Rahul Gupta and Charith Peris},
  journal= {arXiv preprint arXiv:2505.21784},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Findings)