中文

激活比例缩放:引导与解释语言模型

计算与语言 2024-10-08 v1 人工智能

摘要

给定提示词“罗马在”,我们能否仅通过对几个相关激活向量进行标量乘法,就将语言模型对错误标记“法国”的预测翻转为正确标记“意大利”?我们认为,成功干预模型是解释其内部工作原理的前提。具体而言,我们确立了三个目标:干预应使正确标记与错误标记互换(有效性),同时不影响其他标记(忠诚性),且保持稀疏性(最小化)。利用梯度优化,我们的目标使我们能够学习(并随后评估)一种特定类型的高效且可解释的干预:激活比例缩放仅修改激活向量的符号幅度,以加强、削弱或反转模型中已编码的引导方向。在合成任务上,该干预在有效性和忠诚性方面与引导向量相当,但更为简洁,允许我们确定可解释模型组件。我们从多个角度评估激活比例缩放,比较不同数据集上的性能,并将激活标量设为激活向量函数,以适应不同长度的提示。

关键词

引用

@article{arxiv.2410.04962,
  title  = {Activation Scaling for Steering and Interpreting Language Models},
  author = {Niklas Stoehr and Kevin Du and Vésteinn Snæbjarnarson and Robert West and Ryan Cotterell and Aaron Schein},
  journal= {arXiv preprint arXiv:2410.04962},
  year   = {2024}
}

备注

Findings of the Association for Computational Linguistics: EMNLP 2024