中文

利用均值中心化改进语言模型中的激活引导

计算与语言 2023-12-08 v1 人工智能 机器学习

摘要

近期在激活引导方面的工作展示了更好地控制大型语言模型(LLMs)输出的潜力,但这涉及寻找引导向量。这很困难,因为工程师通常不知道这些模型中特征是如何表示的。我们试图通过将均值中心化的思想应用于引导向量来解决这一问题。我们发现,取与目标数据集相关的激活平均值,然后减去所有训练激活的均值,可以得到有效的引导向量。我们在多种模型上通过自然语言任务测试了该方法,包括引导模型远离生成有毒文本,以及将故事的补全引导至目标体裁。我们还将均值中心化应用于提取函数向量,以显著更大的优势(与之前的基线相比)更有效地触发一系列自然语言任务的执行。这表明均值中心化可以轻松提升在广泛场景下激活引导的有效性。

关键词

引用

@article{arxiv.2312.03813,
  title  = {Improving Activation Steering in Language Models with Mean-Centring},
  author = {Ole Jorgensen and Dylan Cope and Nandi Schoots and Murray Shanahan},
  journal= {arXiv preprint arXiv:2312.03813},
  year   = {2023}
}