中文

CEE:基于子空间概念旋转的仿身智能推理时防御

密码学与安全 2026-01-06 v3 机器学习 多智能体系统

摘要

大型语言模型(LLM)广泛用于仿身智能(EI)系统中的任务理解和动作规划,但其采用显著增加了对jailbreak攻击的 vulnerability。尽管 recent work explore 推理时防御,但 existing 方法依赖于针对中间 representation 的 static intervention,这往往会降低生成 quality并 impair task instructions 的 adherence,从而降低EI setting 中的 system usability。我们提出了 dynamic defense framework。对于每个EI推理请求,我们动态构建 task-specific safety-semantic subspace,将其 hidden state 投影到最相关的 direction,并应用SLERP rotation进行 adaptive safety control。在相当于的 defense success rate下,我们的方法在保持生成 quality方面表现出色,改善了 usability,减少了 tuning cost,并在EI scenario中加强了 robustness。

关键词

引用

@article{arxiv.2504.13201,
  title  = {CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation},
  author = {Jirui Yang and Zheyu Lin and Zhihui Lu and Yinggui Wang and Lei Wang and Tao Wei and Qiang Duan and Xin Du and Shuhan Yang},
  journal= {arXiv preprint arXiv:2504.13201},
  year   = {2026}
}