基于潜在可达性的LLM误差对齐预检测与引导
机器学习
2025-09-29 v1 人工智能
摘要
大语言模型(LLM)如今已广泛应用于日常工具,引发关于其生成有害内容的安全问题的紧迫关切。当前主流的安全方法——基于人类反馈的强化学习(RLHF)——在训练期间有效塑造模型行为,但在推理期间不提供保障,unsafe continuations仍可能产生。我们提出BRT-Align,一种基于可达性的框架,将控制论安全工具引入LLM推理。BRT-Align将自回归生成建模为潜在空间中的动力系统,通过反向可达性学习安全价值函数,估算轨迹的最坏情况演化。这两种互补机制:(1) 运行时监视器提前数个token预测unsafe完成;(2) 最不限制性引导滤波器最小扰动潜在状态,以将生成引导 away于unsafe区域。跨多个LLM和毒性基准的实验表明,BRT-Align在检测unsafe完成方面比基线更准确且更早。此外,对于LLM安全对齐,BRT-Align在大幅减少unsafe生成的同时,保留句子多样性和连贯性。定性结果进一步凸显了新出现的对齐属性:BRT-Align一致产生更不暴力、更不粗鲁、更不冒犯且更不具政治偏见的响应。这些发现表明,可达性分析为LLM推理时安全提供原则且实用的基础。
引用
@article{arxiv.2509.21528,
title = {Preemptive Detection and Steering of LLM Misalignment via Latent Reachability},
author = {Sathwik Karnik and Somil Bansal},
journal= {arXiv preprint arXiv:2509.21528},
year = {2025}
}