基于 LLM 激活空间消相关的无训练策略违规检测
机器学习
2026-01-21 v3
摘要
随着组织在法律、金融和医疗等敏感领域部署大语言模型 (LLM),确保其符合内部组织政策已成为优先事项。现有内容 moderation 框架主要局限于安全领域,难以捕捉细微的组织政策。LLM 作为裁判器和微调方法虽灵活,但引入显著的延迟和训练成本。为此,我们将政策违规检测建模为模型激活空间中的离分布 (OOD) 问题。我们提出一种无训练方法,直接作用于 LLM 的内部表示,利用决策相关信息编码于激活中的先验证据。灵感来源于消相关技术,我们对 LLM 的隐藏激活应用线性变换进行消相关和标准化处理,并以欧几里得范数作为检测政策违规的合规得分。该方法仅需政策文本和少量示例样本,即可实现轻量级部署。我们在多个 LLM 和具挑战性的政策基准上进行了广泛评估,实现 86.0% 的 F1 分数,相较于微调基线提升最高 9.1 分,相较于 LLM 作为裁判器提升 16 分,计算成本显著降低。代码已公开:https://github.com/FujitsuResearch/LLM-policy-violation-detection
引用
@article{arxiv.2512.03994,
title = {Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs},
author = {Oren Rachmil and Avishag Shapira and Roy Betser and Itay Gershon and Omer Hofman and Asaf Shabtai and Yuval Elovici and Roman Vainshtein},
journal= {arXiv preprint arXiv:2512.03994},
year = {2026}
}
备注
Accepted to the AAAI 2026 Deployable AI (DAI) Workshop