通过推理时激活能缓解对齐型大型语言模型的过度拒绝问题
机器学习
2026-03-04 v2 人工智能
计算与语言
机器学习
摘要
当前大型语言模型的安全对齐面临一个核心挑战:现有对齐技术常常在缓解有害提示的响应方面优先,却以过于谨慎的行为为代价,导致模型错误地拒绝善意请求。安全对齐的关键目标因此是在提高安全性的同时最小化误拒。本文引入一种新型、无需微调的框架——能景引导(Energy Landscape Steering, ELS),通过动态推理时干预来解决此挑战。我们训练一个轻量级外部能量基模型(Energy-Based Model, EBM),为不可接受的状态(误拒或越狱)分配高能量,为可接受的状态(有帮助的响应或安全拒绝)分配低能量。在推理过程中,EBM将LLM的内部激活映射到能景上,并利用能量函数的梯度实时将隐藏状态引导至低能量区域。这种动态方式无需修改模型参数即可引导模型实现可接受行为。通过将行为控制从模型核心知识中解耦,ELS提供了一种灵活且计算高效的解决方案。广泛的实验表明,该方法在多样化模型上均显著有效,将ORB-H基准上的合规率从57.3%提升至82.6%,同时保持基础安全性能。我们的工作确立了构建同时实现高安全性和低误拒率的LLM的有前景的范式。
引用
@article{arxiv.2510.08646,
title = {Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy},
author = {Eric Hanchen Jiang and Weixuan Ou and Run Liu and Shengyuan Pang and Guancheng Wan and Ranjie Duan and Wei Dong and Kai-Wei Chang and XiaoFeng Wang and Ying Nian Wu and Xinfeng Li},
journal= {arXiv preprint arXiv:2510.08646},
year = {2026}
}