中文

单次优化引导向量在LLM中介导安全相关行为

机器学习 2025-08-14 v2 人工智能

摘要

引导向量(SV)已成为解释和控制LLM的有前景方法,但当前方法通常需要大型对比数据集,而这些数据集往往难以构建且可能捕获虚假关联。我们提出通过对单个训练示例进行梯度下降来直接优化SV,并系统性地研究这些SV如何泛化。我们考虑了几种SV优化技术,发现所得SV有效介导多个模型中的安全相关行为。事实上,在一个对齐伪装模型的实验中,我们能够优化出单次SV,使其在良性示例上引发有害行为,其否定形式可抑制恶意示例上的有害行为。在拒绝抑制实验中,我们证明单次优化SV可跨输入迁移,实现96.9%的Harmbench攻击成功率。此外,我们扩展了关于"突现失控"的工作,表明优化以诱使模型编写脆弱代码的SV,会导致模型在无关的开放式提示上产生有害响应。最后,我们利用单次SV优化来探讨指令调优LLM在输出错误信息后如何恢复,发现该恢复能力与模型是否明确表述信息为错误无关。总体而言,我们的发现表明,针对单个示例优化SV可介导LLM中各种误导行为。代码可在https://github.com/jacobdunefsky/one-shot-steering-repro和https://github.com/jacobdunefsky/one-shot-steering-misalignment中找到。

关键词

引用

@article{arxiv.2502.18862,
  title  = {One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs},
  author = {Jacob Dunefsky and Arman Cohan},
  journal= {arXiv preprint arXiv:2502.18862},
  year   = {2025}
}

备注

Published at COLM 2025. 30 pages, 7 figures. Code is available at https://github.com/jacobdunefsky/one-shot-steering-repro and https://github.com/jacobdunefsky/one-shot-steering-misalignment