大型语言模型中的表示流形的起源
机器学习
2025-05-27 v1 人工智能
摘要
在机制可解释性方面,有一个大规模的持续性科学努力,旨在将人工智能系统的嵌入和内部表示映射到人类可理解的概念中。这一努力的关键要素是稀疏表示假设,它认为神经表示是`几乎正交'方向向量的稀疏线性组合,反映了不同特征的存在或缺失。这种模型为使用稀疏自编码器从表示中恢复特征提供了依据。致力于构建更完整的特征模型,其中神经表示不仅可以编码特征的存在,还可以编码潜在的连续和多维特征值,这一主题近期引发了激烈的讨论。我们描述了特征如何可能以流形形式表示的原因和方法,特别是展示了余弦相似度在表示空间中可能通过最短的流形路径编码特征内在几何的机制,从而可能回答了表示空间距离与概念空间相关性如何相连的问题。该理论的关键假设和预测在大型语言模型的文本嵌入和标记激活上得到了验证。
引用
@article{arxiv.2505.18235,
title = {The Origins of Representation Manifolds in Large Language Models},
author = {Alexander Modell and Patrick Rubin-Delanchy and Nick Whiteley},
journal= {arXiv preprint arXiv:2505.18235},
year = {2025}
}
备注
16 pages, 4 figures