利用激活工程引导语言模型
计算与语言
2024-10-11 v5 机器学习
摘要
提示工程与微调旨在最大化语言模型在给定指标(如毒性降低)上的表现。然而,这些方法并未充分激发模型的能力。为缩小这一差距,我们引入激活工程:在推理时修改激活以控制(或引导)模型输出。具体而言,我们提出激活加法(ActAdd)技术,其对比提示对(如“爱”与“恨”)上的中间激活来计算引导向量(Subramani 等,2022)。通过在前向传播中有策略地加入例如“爱”−“恨”引导向量,我们在使用包括 LLaMA-3 和 OPT 在内的模型进行负到正情感迁移与去毒化方面达到了 SOTA。ActAdd 实现了对高层输出属性(如主题与情感)的推理时控制,同时保持了在非目标任务上的性能。ActAdd 轻量:它不需要任何机器优化,且仅需一对数据点即可工作,从而支持快速的引导迭代。ActAdd 展示了激活工程的力量。
引用
@article{arxiv.2308.10248,
title = {Steering Language Models With Activation Engineering},
author = {Alexander Matt Turner and Lisa Thiergart and Gavin Leech and David Udell and Juan J. Vazquez and Ulisse Mini and Monte MacDiarmid},
journal= {arXiv preprint arXiv:2308.10248},
year = {2024}
}