中文

别再盯着提示词:推理劫持与约束紧缩的红队测试方法

计算与语言 2026-04-14 v2

摘要

随着 LLM 基于智能体在各个领域的广泛应用,其复杂性引入了新的安全威胁。现有的红队方法大多依赖修改用户提示词,这些方法缺乏对新数据的适应性,可能影响智能体的性能。为挑战这一难题,本文提出了 JailAgent 框架,完全避免修改用户提示词。具体而言,它隐式地操控智能体的推理轨迹和记忆检索,包含三个关键阶段:触发提取、推理劫持和约束紧缩。通过精确的触发识别、实时自适应机制以及优化的目标函数,JailAgent 在跨模型和跨情境环境中展现出卓越的性能。

关键词

引用

@article{arxiv.2604.05549,
  title  = {Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents},
  author = {Yanxu Mao and Peipei Liu and Tiehan Cui and Congying Liu and Mingzhe Xing and Datao You},
  journal= {arXiv preprint arXiv:2604.05549},
  year   = {2026}
}