在 RLHF 对齐语言模型中通过输出子空间边界处的 Logit 抑制消除非答案
计算与语言
2025-06-02 v1 机器学习
摘要
我们引入了一种在不修改模型权重或提示的情况下,降低大型语言模型 (LLM) 对敏感内容拒绝率的方法。基于观察到某些模型中的拒绝通常发生在特定词元序列之后,即标记思维链 (CoT) 块开始 () 后跟一个双换行符词元 (\n\n),我们研究了生成过程中两种简单格式调整的影响:在 之后抑制 \n\n,以及在 CoT 块结束 () 之后抑制序列结束词元。我们的方法不需要数据集、参数更改或训练,仅依赖于在生成过程中修改词元概率。在我们使用官方 DeepSeek-R1 蒸馏模型的实验中,这些干预措施提高了对敏感提示的实质性回答比例,且未影响在标准基准测试上的性能。我们的研究结果表明,可以通过在生成过程中的特定点阻断拒绝子空间来规避拒绝行为。
引用
@article{arxiv.2505.23848,
title = {Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models},
author = {Harvey Dam and Jonas Knochelmann and Vinu Joseph and Ganesh Gopalakrishnan},
journal= {arXiv preprint arXiv:2505.23848},
year = {2025}
}