大型语言模型对齐的光谱编辑激活
计算与语言
2024-11-05 v3 人工智能
机器学习
摘要
大型语言模型(LLMs)常表现出不希望的行为,如生成不真实或偏见内容。对其内部表示进行编辑已被证明在现有对齐方法之上有效地缓解此类行为。我们提出一种新颖的推理时编辑方法,称为激活光谱编辑(SEA),将输入表示投影到与正面演示(如真实)最大协方差的方向上,同时最小化与负面演示(如幻觉)的协方差。我们还将方法扩展到非线性编辑中使用特征函数。我们对在涉及真实性和偏见的基准测试上进行了大量实验,使用来自不同大小和模型家族的六个开源LLMs。结果表明,SEA在有效性、对类似任务的泛化以及计算和数据效率方面均优于其他方法。我们还表明,SEA编辑仅对其他模型能力影响有限。
引用
@article{arxiv.2405.09719,
title = {Spectral Editing of Activations for Large Language Model Alignment},
author = {Yifu Qiu and Zheng Zhao and Yftah Ziser and Anna Korhonen and Edoardo M. Ponti and Shay B. Cohen},
journal= {arXiv preprint arXiv:2405.09719},
year = {2024}
}
备注
24 pages, NeurIPS 2024