大型语言模型特征空间语义结构
计算与语言
2026-05-01 v1 机器学习
摘要
我们表明,大型语言模型隐藏状态中语义特征的几何关系与人类心理关联关系高度吻合。我们构建对应360个单词的特征向量,并在32个语义轴上进行投影(例如美丽-丑陋、柔软-坚硬),发现这些投影与人类对这些单词在各语义尺度上的评价高度相关。其二是,我们发现语义轴之间的余弦相似性高度预测了这些尺度在调查中的相关性。其三是,我们表明在这32个语义轴之间的显著方差位于低维子空间内,复现了典型人类语义关联模式。最后,我们展示了在一个语义轴上操控一个单词,会对模型在其他语义尺度上对该单词的评估产生比例于这些语义轴之间余弦相似性的溢出效应。这些发现表明,特征不仅应被理解为孤立实体,更应通过它们的几何关系以及形成的有意义子空间来理解。
引用
@article{arxiv.2604.27169,
title = {Semantic Structure of Feature Space in Large Language Models},
author = {Austin C. Kozlowski and Andrei Boutyline},
journal= {arXiv preprint arXiv:2604.27169},
year = {2026}
}