面向线性表征假设的灵活框架:基于最大似然估计
机器学习
2025-02-25 v1 计算与语言
摘要
线性表征假设认为,高层次概念在大语言模型(LLM)的表征空间中编码为线性方向。Park 等人(2024)通过引入因果内积,将线性表征的多种解释(如1维子空间表征和干预)统一形式化。然而,其框架依赖单token的反事实配对,无法处理含糊的对比配对,限制了其在复杂或情境依赖性概念上的适用性。我们提出一种新的二元概念表述,即将其视为标准表征空间中的单位向量,利用LLM(神经网络)激活差分,并结合最大似然估计(MLE),计算概念方向(即驾驶向量)。我们的方法SAND(Sum of Activation-based Normalized Difference)将激活差分建模为来自von Mises-Fisher(vMF)分布的样本,提供了一种以原则方式推导概念方向的方法。通过消除对解嵌入表征和单token配对的依赖,扩展了Park等人(2024)的适用性。实验使用LLaMA模型在多样概念和基准测试上表明,我们的轻量级方法在灵活性、激活工程任务(如监控和操控)方面表现优异。
引用
@article{arxiv.2502.16385,
title = {Toward a Flexible Framework for Linear Representation Hypothesis Using Maximum Likelihood Estimation},
author = {Trung Nguyen and Yan Leng},
journal= {arXiv preprint arXiv:2502.16385},
year = {2025}
}