中文

关于大语言模型在推理时几乎必然安全对齐的研究

机器学习 2025-06-23 v3 计算与语言

摘要

我们引入了一种新颖的 LLM 推理时对齐方法,旨在几乎必然地生成安全响应,即概率趋近于 1。我们的方法将安全响应的生成建模为 LLM 潜在空间内的一个约束马尔可夫决策过程 (MDP)。我们增加了一个安全状态来跟踪安全约束的演变,并动态惩罚不安全的生成,以确保生成安全的响应。因此,我们证明了在潜在空间中用足够大的惩罚求解 MDP 时,相对于给定的成本模型,具有形式化的安全保证。在此基础上,我们提出了 InferenceGuard,这是一种在不修改模型权重的情况下安全对齐 LLM 的实用实现。通过实验,我们证明 InferenceGuard 有效地平衡了安全性和任务性能,在生成安全且对齐的响应方面优于现有的推理时对齐方法。我们的发现通过推理时对齐推动了更安全的 LLM 部署,从而为资源密集型、易过拟合的对齐技术(如 RLHF)提供了一种有前景的替代方案。

关键词

引用

@article{arxiv.2502.01208,
  title  = {On Almost Surely Safe Alignment of Large Language Models at Inference-Time},
  author = {Xiaotong Ji and Shyam Sundhar Ramesh and Matthieu Zimmer and Ilija Bogunovic and Jun Wang and Haitham Bou Ammar},
  journal= {arXiv preprint arXiv:2502.01208},
  year   = {2025}
}