中文

语言模型隐藏状态中的民族编码:面向 persona 条件学术文本的文化差异化表征探测

计算与语言 2026-04-15 v2

摘要

大语言模型日益被用作写作工具和教学资源,但是否在生成学术文本时编码了文化差异化的表征尚不明确。本研究检验 Gemma-3-4b-it 是否在生成以英国人和中国人学术人格为条件的研究论文介绍时,将民族差异信息编码于隐藏状态中。我们生成 270 篇文本,基于 45 个提示模板与六种人格条件的 2x3 设计交叉。对所有 35 层的隐藏状态激活训练 logistic 回归探测器,采用混合标签基线、surface-text skyline 分类器、跨家族测试以及句子级基线作为控制。探测器选定的 token 位置被标注为结构特征、词汇特征和立场特征。民族探测器在第 18 层达到 0.968 的交叉验证准确率,表现完美。民族编码遵循非单调轨迹演化,结构效应在中到上层最强,而词汇-域效应则在更早阶段达到峰值。在高信号 token 位置,英国关联模式显示更多后修饰、缓和、提升、被动语态以及评估性或过程导向词汇,而中国关联模式显示更多前修饰、名词谓语和社会文化或国际化词汇。然而,句子级分析发现全生成 surface text 中未见显著的民族差异。我们的发现将探测方法扩展至社会语言学属性,并对 EAP(English for Academic Purposes,英语学术用途)和语言教学具有实际意义。

关键词

引用

@article{arxiv.2604.10151,
  title  = {Nationality encoding in language model hidden states: Probing culturally differentiated representations in persona-conditioned academic text},
  author = {Paul Jackson and Ruizhe Li and Elspeth Edelstein},
  journal= {arXiv preprint arXiv:2604.10151},
  year   = {2026}
}

备注

42 pages, 6 tables