中文

LPG:在潜在策略警戒中平衡效率与策略推理

密码学与安全 2026-05-19 v1 人工智能

摘要

警戒措施是现代人工智能系统的关键安全层,但其运行模式正在发生变化。随着LLM作为定制助手部署,安全策略日益在推理时由用户、组织或监管环境指定。这使得安全执行从根本上具有动态性:警戒应能够在不重新训练的情况下适应变化的安全策略。然而,这一要求创造了根本性的张力:对复杂策略情境进行忠实判断需要推理能力,而实际部署则要求低延迟响应。我们引入潜在策略警戒(LPG),一种学习语义潜在 deliberation 以应对动态策略的警戒框架。LPG将用于意图解释和策略对齐所需的内部 deliberation压缩为由决策相关语义监督的连续状态。在推理时,它仅生成一个以违反策略条款为锚点的紧凑 verdict,同时保留可审计性,避免显式推理的延迟。在策略警戒基准测试中,LPG-4B达到84.5%的平均安全准确率和77.9%的F1分数,通过将 deliberation压缩为仅10个潜在 token,在最强的动态基线之上,同时在单样本评估设置下大约比Qwen3-4B-Thinking快11倍。代码和数据可在 https://github.com/SaFo-Lab/Latent_Policy_Guard 获取。

关键词

引用

@article{arxiv.2605.17329,
  title  = {LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails},
  author = {Nanxi Li and Zhengyue Zhao and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2605.17329},
  year   = {2026}
}