分析特征流以提升语言模型的解释与操控能力
机器学习
2025-07-28 v3 计算与语言
摘要
我们提出了一种新方法,系统性地映射稀疏自编码器在大型语言模型连续层中发现的特征,扩展了此前检查层间特征链接的工作。通过采用无数据驱动的余弦相似度技术,我们追踪特定特征在每个阶段的持久性、变换或首次出现的情形。该方法生成特征演化的粒细流图,使我们能够实现对模型计算的细粒度解释和机制性洞察。关键在于,我们展示了这些跨层特征映射如何通过放大或抑制所选特征,直接操控模型行为,从而实现对文本生成的精准主题控制。总体而言,我们的发现凸显了一种因果、跨层解释框架的实用性,不仅阐明了特征如何通过前向传播发展,而且为透明操控大型语言模型提供了新方法。
引用
@article{arxiv.2502.03032,
title = {Analyze Feature Flow to Enhance Interpretation and Steering in Language Models},
author = {Daniil Laptev and Nikita Balagansky and Yaroslav Aksenov and Daniil Gavrilov},
journal= {arXiv preprint arXiv:2502.03032},
year = {2025}
}