面向阅读与引导LLM状态的脑基轴
机器学习
2025-12-24 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)的解释性方法通常从文本监督中派生方向,这可能缺乏外部 grounding。我们提出使用人类脑活动不是作为训练信号,而是作为读取和引导LLM状态的坐标系。利用SMN4Lang MEG数据集,我们构建了基于相位锁定值(PLV)模式的词级脑图谱,并通过主成分分析(ICA)提取潜在轴。我们用独立词典和NER-based标签(用作校查)验证了轴,并训练轻量级适配器将LLM隐藏状态映射到这些脑轴,而无需对LLM进行微调。沿所得脑派生方向进行引导,可在TinyLlama中获得一个鲁棒的词汇(频率关联)轴,能抵御困惑度匹配的控制,并表明脑轴与文本探针相比,更大程度地产生log频率偏移(同时更低的困惑度)。功能/内容轴(轴13)在TinyLlama、Qwen2-0.5B和GPT-2中均表现出一致的引导效果,尽管TinyLlama中第4层的效应较大但不一致,因此我们将其视为次要的(见附录)。轴结构在不使用GPT嵌入变更特征或使用word2vec嵌入重建图谱时保持稳定(匹配轴的相关系数|r|=0.64-0.95),降低了循环一致性的担忧。探索性fMRI锚定表明潜在的嵌入变更和log频率对齐,但效果取决于血氧模型假设,仅作为人口水平证据。这些结果支持一种新型接口:神经生理学 grounding的轴为LLM行为提供可解释且可控的句柄。
引用
@article{arxiv.2512.19399,
title = {Brain-Grounded Axes for Reading and Steering LLM States},
author = {Sandro Andric},
journal= {arXiv preprint arXiv:2512.19399},
year = {2025}
}
备注
10 pages, 4 figures. Code: https://github.com/sandroandric/Brain-Grounded-Axes-for-Reading-and-Steering-LLM-States