AEric:用于隐式有害对话的预期隐藏状态监控
摘要
当前语言模型面临两个安全挑战:风险必须被及时检测,以避免暴露有害 continuation,而有害性本身可能是隐式的,而不以明显有毒文本信号化。现有的响应级别警卫在判断已完成文本方面力强,而本机流式警卫在接近 token 时间更接近,但两种设置都留下了轻量级监控能否从生成器自身内部轨迹中预期隐式有害漂移的问题。我们研究了 anticipatory 同 pass 监控,即安全监控器可读取普通解码期间产生的隐藏状态,但不能调用基础模型的额外前向 pass。我们引入 AERIC,一种面向隐式有害对话的迁移导向隐藏状态方法,结合了短期风险预测、支持敏感抑制和以提示条件为导向的残差评分,采用同 pass 指数移动平均决策规则。默认线性监控器仅包含 387 个可训练头参数。在 Qwen3GuardStream-4B 上进行的平衡基准测试中,AEric 将 DiaSafety 上的 AUROC 从 0.6830 提升至 0.7143,将 Harmful Advice 上的 AUROC 从 0.8219 提升至 0.8582。对于 promptlevel trigger 基准,我们通过源侧安全预算规则校准 AERIC阈值,以最大化触发覆盖率的同时将安全触发率限制在 10% 以下。在该规则下,trigger@64 在 HarmBench DirectRequest 和 SocialHarmBench 上分别达到 0.6438 和 0.4656,在 Qwen 和 Gemma 上分别为 0.6849 和 0.7363,平均 withholding 23.53 至 41.86 个 answer token。同 pass 部署也很高效:在 Qwen3-8B 上对 63 条 harmfulprompt 固定生成基准(汇总自 HarmBench DirectRequest 和 SocialHarmBench)中,监控器将平均延迟增加仅 2.34%,而 Qwen3Guard-Stream-4B 将其增加 79.40%。
引用
@article{arxiv.2605.23974,
title = {AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue},
author = {Jihyung Park and Saleh Afroogh and Junfeng Jiao},
journal= {arXiv preprint arXiv:2605.23974},
year = {2026}
}