大型语言模型隐藏状态中的类别感知:数字位数边界处的结构性变形
计算与语言
2026-04-27 v2 人工智能
摘要
类别感知(CP)——即在类别边界处增强的可辨识性——是感知心理学中最受研究的现象之一。本文报告了类似的几何变形发生在处理阿拉伯数字时,大型语言模型(LLM)隐藏状态表示中。通过对六个来自五个架构家族的模型进行表征相似性分析,研究发现,CP-加法模型(对数距离加边界提升)在测试的每个模型中的所有主要层,均比纯连续模型更好地拟合表征几何。该效应特定于结构定义的边界(数字位数转换的边界,如10和100),在非边界控制位置不存在,在温度域中也不存在,其中语言类别(热/冷)缺乏词元化断点。出现两种质化的不同签名:经典CP(Gemma、Qwen),其中模型显式分类且显示几何变形;结构CP(Llama、Mistral、Phi),其中几何在边界处变形但模型无法报告类别区别。这种分离在边界之间保持稳定,是体系结构的属性,而非刺激的属性。结构性输入格式断裂足以在大型语言模型中产生类别感知几何,独立于显式语义类别知识。
引用
@article{arxiv.2603.28258,
title = {Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries},
author = {Jon-Paul Cacioli},
journal= {arXiv preprint arXiv:2603.28258},
year = {2026}
}
备注
25 pages, 5 figures, 7 tables. Pre-registered on OSF (osf.io/qrxf3). Code at https://github.com/synthiumjp/weber