中文

使用引导方法的语言模型中对齐与有用性之间的权衡

计算与语言 2025-05-28 v5 人工智能

摘要

语言模型对齐已成为AI安全的重要组成部分,通过增强期望行为并抑制不期望行为,实现人类与语言模型之间的安全交互。这通常通过微调模型或插入预设的对齐提示来完成。最近,表征工程——一种通过改变模型训练后的表征来改变模型行为的方法——被证明在对齐大型语言模型(LLM)方面是有效的(Zou et al., 2023a)。表征工程在对齐导向的任务(如抵抗对抗性攻击和减少社会偏见)中取得了增益,但也显示出会导致模型执行基本任务的能力下降。在本文中,我们研究了模型对齐度增加与有用性下降之间的权衡。我们提出了一个理论框架,为这两个量提供了界限,并通过实验证明了它们的相关性。首先,我们发现在我们的框架条件下,可以通过表征工程保证对齐,但同时在此过程中有用性会受损。其次,我们表明有用性受损的程度与表征工程向量的范数成二次方关系,而对齐度则与之成线性增加关系,这表明存在一个使用表征工程是高效的区域。我们通过实验验证了我们的发现,并描绘了表征工程用于对齐的有用性边界。

关键词

引用

@article{arxiv.2401.16332,
  title  = {Tradeoffs Between Alignment and Helpfulness in Language Models with Steering Methods},
  author = {Yotam Wolf and Noam Wies and Dorin Shteyman and Binyamin Rothberg and Yoav Levine and Amnon Shashua},
  journal= {arXiv preprint arXiv:2401.16332},
  year   = {2025}
}