中文

通过安全表示排序提升大语言模型的安全对齐

计算与语言 2025-05-22 v1 机器学习

摘要

大语言模型(LLM)的快速发展在 various tasks 中展现出里程碑式的成功,但其生成有害内容的潜力引发了重大的安全担忧。现有的安全评估方法通常直接针对文本响应进行操作,忽略了模型内部表示中蕴含的丰富信息。本文提出了安全表示排序(Safety Representation Ranking, SRR),一种一种列表排序框架,用于使用 LLM 本身的隐藏状态选择安全响应。SRR 通过对指令和候选完成进行编码,使用中间 transformer 表示,并通过轻量级基于相似性的评分器对候选答案进行排序。该方法直接利用内部模型状态并在列表层面进行监督,以捕捉细微的安全信号。实验表明,SRR 在多个基准测试中显著提高了对对抗性提示的鲁棒性。我们的代码将在发表后公开。

关键词

引用

@article{arxiv.2505.15710,
  title  = {Advancing LLM Safe Alignment with Safety Representation Ranking},
  author = {Tianqi Du and Zeming Wei and Quan Chen and Chenheng Zhang and Yisen Wang},
  journal= {arXiv preprint arXiv:2505.15710},
  year   = {2025}
}