中文

线性社会人口表征从大语言模型的间接线索中涌现

人工智能 2025-12-12 v1 人机交互

摘要

我们研究了大型语言模型(LLMs)如何从名称和职业等间接线索推断人类对话伙伴的社会人口属性。我们证明 LLMs 在激活空间中发展了用户人口统计特征的线性表征,其中刻板印象关联的属性沿可解释的几何方向编码。我们首先探测四个开放变换器基础 LLMs(Magistral 24B、Qwen3 14B、GPT-OSS 20B、OLMo2-1B)的残差流,这些模型以明确的人口统计披露作为提示。我们证明相同的探针可以从间接线索预测人口统计:名称激活与人口普查对齐的性别和种族表征,而职业触发与真实世界劳动力统计数据相关的表征。这些线性表征使我们能够解释 LLM 在对话中隐含形成的人口统计推断。我们证明这些隐含的人口统计表征积极地影响下游行为,如职业推荐。我们的研究进一步指出,通过偏见基准测试的模型仍可能潜伏并利用隐含偏见,这对大规模应用中的公平性有重要意义。

关键词

引用

@article{arxiv.2512.10065,
  title  = {Linear socio-demographic representations emerge in Large Language Models from indirect cues},
  author = {Paul Bouchaud and Pedro Ramaciotti},
  journal= {arXiv preprint arXiv:2512.10065},
  year   = {2025}
}