基于特征引导激活添加实现大语言模型的可解释驾驭
机器学习
2025-04-03 v3 人工智能
计算与语言
摘要
有效且可靠地控制大语言模型(LLM)行为是一个重要挑战。虽然激活驾驭方法——即将驾驶向量添加到模型隐藏状态中——是一个有前景的做法,但现有技术在如何影响模型输出的精度和可解释性方面往往不足。我们引入特征引导激活添加(Feature Guided Activation Additions, FGAA),这是一种新型的激活驾驶方法,利用来自对比激活添加(Contrastive Activation Addition, CAA)和稀疏自编码器-目标驾驶(Sparse Autoencoder-Targeted Steering, SAE-TS)的洞见。通过在稀疏自编码器的潜在空间中运作,并采用优化技术选择所需的 SAE 特征,FGAA构建出精确的驾驶向量,提供更好的驾驶效果,同时保持被驾驶模型输出的连贯性。在此方面,针对Gemma-2-2B和Gemma-2-9B模型在各种驾驶任务上的评估表明,FGAA在CAA、SAE 解码器驾驶和SAE-TS方面的现有驾驶方法中表现更出色。我们的结果还突显了驾驶规模与通用模型能力之间在所有所测试的驾驶方法中保持一致的重要权衡。
引用
@article{arxiv.2501.09929,
title = {Interpretable Steering of Large Language Models with Feature Guided Activation Additions},
author = {Samuel Soo and Chen Guang and Wesley Teng and Chandrasekaran Balaganesh and Tan Guoxian and Yan Ming},
journal= {arXiv preprint arXiv:2501.09929},
year = {2025}
}
备注
9 maintext pages, 13 appendix pages