中文

安全对齐中的维度之福与祸

人工智能 2025-07-29 v1 机器学习 机器学习

摘要

大语言模型(LLM)在不同领域的广泛应用推动了其安全对齐工作的重视程度。LLM的规模是其成功的一个 Contributing 因素,参数数量的增长遵循更大的隐藏维度。在本文中,我们假设虽然维度的增加是关键优势,但也可能引发新问题。这些问题以激活空间中的线性结构被利用,形式为激活工程,从而规避其安全对齐。通过对不同模型规模下与不同概念(如安全性)相关的线性子空间进行详细可视化,我们展示了高维表示的诅咒在LLM中独特地产生了影响。进一步地,我们证明将模型表示投影到更低维子空间中可以保留足够的信息用于对齐,同时避免这些线性结构。实证结果表明,这种维度缩减显著减少了通过表示工程进行的入侵检测(jailbreaking)的易受性。基于我们的实证验证,我们为这些线性入侵方法相对于模型隐藏维度的理论见解。广义而言,本文认为模型内部表示的高维度既是安全对齐的福,也是祸。

关键词

引用

@article{arxiv.2507.20333,
  title  = {The Blessing and Curse of Dimensionality in Safety Alignment},
  author = {Rachel S. Y. Teo and Laziz U. Abdullaev and Tan M. Nguyen},
  journal= {arXiv preprint arXiv:2507.20333},
  year   = {2025}
}

备注

Published as a conference paper at COLM 2025