通过靶向稀疏自编码器特征改进导向向量
机器学习
2024-11-22 v2 人工智能
计算与语言
摘要
为了控制语言模型的行为,导向方法试图确保模型的输出满足特定的预定义属性。向模型添加导向向量是一种有前景的模型控制方法,比微调更容易,且可能比提示更鲁棒。然而,很难预见由 CAA [Panickssery et al., 2024] 等方法产生的导向向量,或直接使用 SAE 隐变量 [Templeton et al., 2024] 的效果。在我们的工作中,我们通过使用 SAE 来测量导向向量的效果来解决这一问题,从而获得一种可以用来理解任意导向向量干预的因果效应的方法。我们利用这种方法测量因果效应,以开发一种改进的导向方法——SAE 导向方法(SAE-TS),该方法寻找导向向量以靶向特定的 SAE 特征,同时最小化意外的副作用。我们表明,总体而言,在一系列任务上的评估中,SAE-TS 在导向效果与连贯性之间的平衡优于 CAA 和 SAE 特征导向。
引用
@article{arxiv.2411.02193,
title = {Improving Steering Vectors by Targeting Sparse Autoencoder Features},
author = {Sviatoslav Chalnev and Matthew Siu and Arthur Conmy},
journal= {arXiv preprint arXiv:2411.02193},
year = {2024}
}
备注
8 maintext pages and 9 appendix pages