中文

大语言模型安全对齐实为伪装的散度估计

机器学习 2025-10-22 v3 人工智能 计算机与社会 机器学习

摘要

我们提出了一个理论框架,表明流行的大语言模型 (LLM) 对齐方法,包括 RLHF 及其变体,可以理解为对齐(安全或偏好)分布与未对齐(有害或非偏好)分布之间的散度估计器。这一视角解释了安全提示和有害提示在对齐后于潜在空间中出现的分离现象。作为我们通用散度框架的一个应用,我们提出了 KLDO,一种新颖的基于 KL 散度的对齐方法,并通过实验验证了其有效性。我们进一步表明,使用合规-拒绝数据集而非标准的基于偏好的数据集,能导致更强的分离并改善安全对齐。最后,为了量化分离效应,我们在提示表示空间中提出了一种基于距离的度量,该度量也可作为模型安全性的统计显著指标。

关键词

引用

@article{arxiv.2502.00657,
  title  = {LLM Safety Alignment is Divergence Estimation in Disguise},
  author = {Rajdeep Haldar and Ziyi Wang and Qifan Song and Guang Lin and Yue Xing},
  journal= {arXiv preprint arXiv:2502.00657},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025