高效表征是可控表征
机器学习
2026-02-10 v1 人工智能
摘要
如何最粗暴地为模型激活中的可解释、可控特征提供安装方案?控制LLM内部表征的方式通常需要先识别,然后干预模型现有特征几何,这需要复杂的方法。我们绕过所有这一切。我们通过简单的辅助损失对LLM进行微调,训练其3072个残差流维度中的16个作为惰性可解释性标记,这些标记仅指示生成所需的概念。模型会围绕这些标记重新组织,学习在实际生成任务中依赖这些标记。结果,这些惰性标记成为真实的内部特征:可解释的控制开关,允许我们在推理时操控生成。为什么有效?当特征可靠地固定在特定位置时,梯度下降会逐渐消除其他位置的冗余编码,模型会自行消解其替代表征。模型的效率压力是一条杠杆——可被利用以诱导可解释、可控的表征。
引用
@article{arxiv.2602.07828,
title = {Efficient Representations are Controllable Representations},
author = {Charles Ye and Jasmine Cui},
journal= {arXiv preprint arXiv:2602.07828},
year = {2026}
}