语言模型引导的圆柱表示假设
计算与语言
2026-05-05 v1
摘要
引导是控制大型语言模型的常用技术,但其效果往往不稳定且难以预测。现有的理论账户主要基于线性表示假设 (LRH)。虽然 LRH 假设概念可以进行正交化以实现无损控制,但这种理想化的映射在实际表示中无法实现,无法解释观察到的不可预测性。通过放宽 LRH 的正交性假设而保留线性表示,我们显示,概念的重叠贡献自然产生样本特定的轴正交结构。我们将此形式化为圆柱表示假设 (CRH)。在 CRH 中,中心轴捕捉概念缺失与存在之间的主要差异,并驱动概念生成。周围的法向平面通过确定轴如何激活目标概念来控制引导灵敏度。在该平面内,只有特定的敏感区能强大促进概念激活,而其他区域则可抑制或延迟其激活。虽然周围的法向平面可以从差分向量中可靠地识别,但敏感区不能,这引入了在区块层面的内在不确定性。这种不确定性为何即使使用 well-aligned 方向,引导结果也常常波动提供了原则性解释。我们的实验验证了圆柱结构的存在,并表明 CRH 为在实际环境中解释模型引导行为提供了有效且实用的方法:https://github.com/mbzuai-nlp/CRH。
引用
@article{arxiv.2605.01844,
title = {The Cylindrical Representation Hypothesis for Language Model Steering},
author = {Lang Gao and Jinghui Zhang and Wei Liu and Fengxian Ji and Chenxi Wang and Zirui Song and Akash Ghosh and Youssef Mohamed and Preslav Nakov and Xiuying Chen},
journal= {arXiv preprint arXiv:2605.01844},
year = {2026}
}
备注
ICML 2026