中文

ReasAlign:针对提示注入攻击的推理增强安全对齐方法

密码学与安全 2026-01-16 v1 人工智能 计算与语言

摘要

大型语言模型 (LLM) 已促进了强大智能体系统的开发,能够自动化处理各领域的复杂工作流程。然而,这些系统对间接提示注入攻击极其敏感,攻击者可通过嵌入外部数据中的恶意指令来劫持智能体的行为。本文提出了 ReasAlign,一种针对间接提示注入攻击的模型级安全对齐解决方案。ReasAlign 的核心思想是引入结构化推理步骤,以分析用户查询、检测冲突指令并保持用户意图任务的连续性,从而抵御间接注入攻击。为进一步确保推理逻辑和准确性,我们引入一种基于偏好优化评判模型的测试时扩展机制,对推理步骤进行评分并选择最佳轨迹。全面评估显示,ReasAlign 在保持实用性方面与未受防御模型相当,同时始终优于最强的先前警戒模型 Meta SecAlign。在包含多种提示注入任务的代表性开放式 CyberSecEval2基准测试中,ReasAlign 实现了 94.6% 的实用性和仅 3.6% 的 ASR,远超 Meta SecAlign(56.4% 实用性和 74.4% ASR),该模型是当前最先进的防御模型。这些结果表明,ReasAlign 在安全性和实用性之间实现了最佳权衡,为实际智能体系统中的提示注入攻击防御建立了稳健且实用的解决方案。我们的代码和实验结果可在 https://github.com/leolee99/ReasAlign 查看。

关键词

引用

@article{arxiv.2601.10173,
  title  = {ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack},
  author = {Hao Li and Yankai Yang and G. Edward Suh and Ning Zhang and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2601.10173},
  year   = {2026}
}

备注

15 pages, 10 figures