中文

面向 LLM 外部分布对齐失效的监控器基准测试与改进

人工智能 2026-05-26 v2 软件工程

摘要

许多大型语言模型(LLM)的安全和对齐失效是由于外部分布(OOD)情形导致的:这些情形是开发者未曾预见的异常提示或响应模式。我们系统性地研究了 LLM 监控管道是否能够检测这些 OOD 对齐失效,通过引入一个名为 Misalignment Out Of Distribution(MOOD)的基准测试。对于面向离线模型的失效案例,已训练在广泛安全数据集上的模型而言,找到真正的 OOD 失效案例极其困难。我们通过在 MOOD 中包含受限制的训练集来规避这一困难,该训练集用于训练我们的监控器,以及七个具有不同对齐失效的测试集,这些失效案例位于训练分布之外。在 MOOD 上,我们发现守卫模型(安全分类器)往往难以在 OOD 情况下泛化。为解决此问题,我们提出将守卫模型与 OOD 检测器组合。我们测试了四种类型的 OOD 检测器,并发现将守卫模型与马哈拉诺斯距离和 perplexity 基于 OOD 检测器的组合可以将召回率从 39% 提升至 45%。我们还在模型规模方面确立了积极的比例趋势对于结合守卫模型和 OOD 检测器的监控器;我们发现将 OOD 检测纳入监控比使用 20 倍参数数的守卫模型实现更高的召回率提升。我们的工作表明,OOD 检测应该是 LLM 监控的关键组成部分,并为进一步解决这一重要问题提供了基础。我们公开发布实验的代码和数据,你可以在此处找到相关链接:https://github.com/Dylan102938/mood-bench。

关键词

引用

@article{arxiv.2605.21602,
  title  = {Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs},
  author = {Dylan Feng and Pragya Srivastava and Anca Dragan and Cassidy Laidlaw},
  journal= {arXiv preprint arXiv:2605.21602},
  year   = {2026}
}