命令语的社交寄存器塑造大语言模型中的指令拓扑
计算与语言
2026-03-27 v1 人工智能
软件工程
摘要
系统提示指令在英语中协作,西班牙语中竞争,具有相同的语义内容但相反的互动拓扑. 我们present对四种语言和四个模型进行的指令级消除实验表明,这种拓扑反转是由社交寄存器所介导的:命令体态在不同言语社群中携带不同的必然力,模型在多语言数据训练中学习了这些惯例. 对单个指令块的声明性重写可将跨语言差异降低 81%(p = 0.029,置换检验). 对 11 个指令块中的 3 个进行声明性重写可将西班牙语指令拓扑从竞争性转为合作性,并对未被重写的块产生溢出效应. 这些发现表明模型将指令处理为社会行为而非技术规范:"NEVER do X" 是权威的行使,力度随语言而异;"X: disabled" 是可跨语言传递的事实描述. 若寄存器在推理时调节指令跟随,推论其在训练时亦如此. 我们将此表述为可检验的预测:以命令体态撰写的宪法 AI 原则可能在语言上产生依赖性的对齐.
引用
@article{arxiv.2603.25015,
title = {Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models},
author = {Tony Mason},
journal= {arXiv preprint arXiv:2603.25015},
year = {2026}
}