中文

无牺牲引导:针对仅限提示词干预的驾驶向量原则化训练

机器学习 2026-05-08 v1

摘要

最近,驾驶向量(steering vectors, SVs)作为有效且轻量级的方法被用于引导大型语言模型(LLM)的行为,其中微调型SVs比无优化型更有效。然而,现有方法存在两大局限:其一,需精确选择每个SVs的驾驶因子以平衡引导效果与生成质量;其二,作为全序列SVs(FSSVs),无论因子选择如何,均可能因对模型生成过程的过度干预而牺牲生成质量。为解决第一个问题,我们提出联合训练驾驶因子与方向,无需事后因子选择。基于神经网络尺度理论,我们发现适度大的初始化规模与学习率对联合训练的稳定性与效率至关重要。为解决第二个问题,我们借鉴表示微调思路,引入仅作用于少数提示词的驾驶向量(Prompt-only SV, PrOSV),其仅在少数提示词上进行干预。我们的实验表明,在联合训练方案下,PrOSV在AxBench上超越传统FSSVs。我们还发现PrOSV在一般模型实用性与对抗鲁棒性之间达到了更好的权衡。

关键词

引用

@article{arxiv.2605.05983,
  title  = {Towards Steering without Sacrifice: Principled Training of Steering Vectors for Prompt-only Interventions},
  author = {Yuntai Bao and Qinfeng Li and Xinyan Yu and Xuhong Zhang and Ge Su and Wenqi Zhang and Liu Yan and Haiqin Weng and Jianwei Yin},
  journal= {arXiv preprint arXiv:2605.05983},
  year   = {2026}
}

备注

63 pages, 50 figures; accepted by ICML 2026