别再盯着提示词:推理劫持与约束紧缩的红队测试方法
计算与语言
2026-04-14 v2
摘要
随着 LLM 基于智能体在各个领域的广泛应用,其复杂性引入了新的安全威胁。现有的红队方法大多依赖修改用户提示词,这些方法缺乏对新数据的适应性,可能影响智能体的性能。为挑战这一难题,本文提出了 JailAgent 框架,完全避免修改用户提示词。具体而言,它隐式地操控智能体的推理轨迹和记忆检索,包含三个关键阶段:触发提取、推理劫持和约束紧缩。通过精确的触发识别、实时自适应机制以及优化的目标函数,JailAgent 在跨模型和跨情境环境中展现出卓越的性能。
引用
@article{arxiv.2604.05549,
title = {Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents},
author = {Yanxu Mao and Peipei Liu and Tiehan Cui and Congying Liu and Mingzhe Xing and Datao You},
journal= {arXiv preprint arXiv:2604.05549},
year = {2026}
}