粒度轴:语言模型中社会角色的微观至宏观潜在方向
人工智能
2026-05-08 v1 计算与语言
摘要
大型语言模型(LLMs)常被提示承担从个体到机构的各类社会角色,然而其内部表示是否编码了此类角色的粒度——从微观层面的个体经验到宏观层面的组织、机构或国家推理——仍不清楚。我们证明了它们确实编码了。我们将基于对比的粒度轴定义为宏观角色与微观角色隐藏状态均值之差。在 Qwen3-8B 中,该轴与角色表示空间的主轴(PC1)在余弦相似度 0.972 处对齐,并解释了其 52.6% 的方差,表明粒度是组织提示社会角色的主导几何轴。我们构建了跨越五个粒度级别的 75 个社会角色,并在共享问题和提示变体上收集了 91,200 个角色条件响应,随后提取角色级隐藏状态并将其投影到该轴上。角色投影在所有五个级别上单调递增,在跨层、提示变体、端点定义、留出划分和分数过滤子集上保持稳定,并可迁移至 Llama-3.1-8B-Instruct。该轴也具有因果相关性:沿其进行激活引导会按预测方向改变响应粒度,在允许局部响应的提示下进行正向引导时,Llama 在五点宏观量表上的得分从 2.00 移至 3.17。两种模型在可控性上存在差异,表明引导依赖于每个模型的默认操作机制。总体而言,我们的研究结果表明,社会角色粒度不仅仅是风格上的表面特征,而是角色条件语言模型行为中结构化、有序且可因果操纵的潜在方向。
引用
@article{arxiv.2605.06196,
title = {The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models},
author = {Chonghan Qin and Xiachong Feng and Ziyun Song and Xiaocheng Feng and Jing Xiong and Lingpeng Kong},
journal= {arXiv preprint arXiv:2605.06196},
year = {2026}
}
备注
28 pages, including appendices