中文

面向变压器的最优激活引导的 FishBack:拉回 Fisher 几何

机器学习 2026-05-19 v1 计算与语言

摘要

激活引导方法修改语言模型的中间表示以控制输出行为,但普遍假设激活空间为欧几里得空间。我们指出这一假设严重错误:由模型自身输出行为诱导的局部几何 —— softmax 层的 Fisher 信息度量,通过后续层的雅可比矩阵的拉回 —— 远离欧几里得度量,在 GPT-2 上相对谱范数偏差超过 97%,有效维度仅为整体空间的 2--17%。从拉回 Fisher 度量出发,我们推导出闭形式的引导方程,识别任意目标概念的最小失真方向,yielding 在每一点可应用的闭形式最优方向,无需流形拟合或数据驱动的几何估计。我们称 resulting 框架为 FishBack。该度量采用分层递归分解,揭示现有方法 —— CAA、ActAdd、ITI 等 —— 每个都隐式采用特定的近似度量,且其性能差异可由单个谱诊断:其隐式度量成本与 Fisher 最优成本之比量化预测。于 GPT-2 来说,迭代拉回引导在三个动词形态概念和四层上始终优于所有欧几里得基线,目标 KL 降低为 1.3×1.3\times--2.5×2.5\times 相对于欧几里得梯度上升,以及 1.5×1.5\times 相对于 CAA 在匹配概念概率下。

关键词

引用

@article{arxiv.2605.17231,
  title  = {FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers},
  author = {Sihan Wang and Jiayi Zhao},
  journal= {arXiv preprint arXiv:2605.17231},
  year   = {2026}
}

备注

Preprint. 20 pages, 9 figures, 5 tables