中文

从浅层到深层:通过因果 GRPO 实现语义意图固定

机器学习 2026-03-04 v1

摘要

大型语言模型尽管具备鲁棒的标准安全措施,仍对对抗前缀攻击(如 "Sure, here is")十分脆弱。我们诊断了这种脆弱性为浅层安全对齐问题,称之为语义表示衰减:随着模型生成合规前缀,其内部恶意意图信号会逐渐消失。为此,我们提出 Two-Stage Causal-GRPO (TSC-GRPO) 框架,以实现意图固定。首先,基于因果可识别性理论,我们训练因果意图探针以分离不变意图与风格扰动。其次,我们通过群相对政策优化将这种因果意识内在于策略中。在 "fork-in-the-road" 训练情境中运用累计因果惩罚,我们迫使模型学习到积累有害 token 会单调降低奖励,从而实现稳健的后期拒绝。实验表明,TSC-GRPO 在抵御 jailbreak 攻击方面显著优于基线方法,同时保持一般实用性。

关键词

引用

@article{arxiv.2603.02675,
  title  = {From Shallow to Deep: Pinning Semantic Intent via Causal GRPO},
  author = {Shuyi Zhou and Zeen Song and Wenwen Qiang and Jiyan Sun and Yao Zhou and Yinlong Liu and Wei Ma},
  journal= {arXiv preprint arXiv:2603.02675},
  year   = {2026}
}