利用均值中心化改进语言模型中的激活引导
计算与语言
2023-12-08 v1 人工智能
机器学习
摘要
近期在激活引导方面的工作展示了更好地控制大型语言模型(LLMs)输出的潜力,但这涉及寻找引导向量。这很困难,因为工程师通常不知道这些模型中特征是如何表示的。我们试图通过将均值中心化的思想应用于引导向量来解决这一问题。我们发现,取与目标数据集相关的激活平均值,然后减去所有训练激活的均值,可以得到有效的引导向量。我们在多种模型上通过自然语言任务测试了该方法,包括引导模型远离生成有毒文本,以及将故事的补全引导至目标体裁。我们还将均值中心化应用于提取函数向量,以显著更大的优势(与之前的基线相比)更有效地触发一系列自然语言任务的执行。这表明均值中心化可以轻松提升在广泛场景下激活引导的有效性。
引用
@article{arxiv.2312.03813,
title = {Improving Activation Steering in Language Models with Mean-Centring},
author = {Ole Jorgensen and Dylan Cope and Nandi Schoots and Murray Shanahan},
journal= {arXiv preprint arXiv:2312.03813},
year = {2023}
}