从关联到激活:比较LLMs中行为与隐藏状态语义几何
机器学习
2026-02-17 v2 人工智能
计算与语言
摘要
我们调查了LLM隐藏状态几何能否从其在心理语言实验中的行为中恢复。在八个经过指令调优的变换模型中,我们运行两种实验范式——基于相似性的强制选择和自由联想——遍历共享的5000词汇表,收集1750万多次试验以构建基于行为的相似性矩阵。通过表征相似性分析,我们将行为几何与逐层隐藏状态相似性进行比较,并对FastText、BERT以及跨模型共识进行基准测试。我们发现,强制选择行为与隐藏状态几何的一致性显著高于自由联想。在 held-out 词汇的回归中,行为相似性(尤其是强制选择)能够预测未看到的隐藏状态相似性,超出词汇基线和跨模型共识,表明仅凭行为测量即可保留有关内部语义几何的可恢复信息。最后,我们讨论了行为任务揭示隐藏认知状态的潜在能力。
引用
@article{arxiv.2602.00628,
title = {From Associations to Activations: Comparing Behavioral and Hidden-State Semantic Geometry in LLMs},
author = {Louis Schiekiera and Max Zimmer and Christophe Roux and Sebastian Pokutta and Fritz Günther},
journal= {arXiv preprint arXiv:2602.00628},
year = {2026}
}
备注
25 pages including references, 15 figures, 6 tables