LPG:在潜在策略警戒中平衡效率与策略推理
密码学与安全
2026-05-19 v1 人工智能
摘要
警戒措施是现代人工智能系统的关键安全层,但其运行模式正在发生变化。随着LLM作为定制助手部署,安全策略日益在推理时由用户、组织或监管环境指定。这使得安全执行从根本上具有动态性:警戒应能够在不重新训练的情况下适应变化的安全策略。然而,这一要求创造了根本性的张力:对复杂策略情境进行忠实判断需要推理能力,而实际部署则要求低延迟响应。我们引入潜在策略警戒(LPG),一种学习语义潜在 deliberation 以应对动态策略的警戒框架。LPG将用于意图解释和策略对齐所需的内部 deliberation压缩为由决策相关语义监督的连续状态。在推理时,它仅生成一个以违反策略条款为锚点的紧凑 verdict,同时保留可审计性,避免显式推理的延迟。在策略警戒基准测试中,LPG-4B达到84.5%的平均安全准确率和77.9%的F1分数,通过将 deliberation压缩为仅10个潜在 token,在最强的动态基线之上,同时在单样本评估设置下大约比Qwen3-4B-Thinking快11倍。代码和数据可在 https://github.com/SaFo-Lab/Latent_Policy_Guard 获取。
引用
@article{arxiv.2605.17329,
title = {LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails},
author = {Nanxi Li and Zhengyue Zhao and Chaowei Xiao},
journal= {arXiv preprint arXiv:2605.17329},
year = {2026}
}