中文

命令语的社交寄存器塑造大语言模型中的指令拓扑

计算与语言 2026-03-27 v1 人工智能 软件工程

摘要

系统提示指令在英语中协作,西班牙语中竞争,具有相同的语义内容但相反的互动拓扑. 我们present对四种语言和四个模型进行的指令级消除实验表明,这种拓扑反转是由社交寄存器所介导的:命令体态在不同言语社群中携带不同的必然力,模型在多语言数据训练中学习了这些惯例. 对单个指令块的声明性重写可将跨语言差异降低 81%(p = 0.029,置换检验). 对 11 个指令块中的 3 个进行声明性重写可将西班牙语指令拓扑从竞争性转为合作性,并对未被重写的块产生溢出效应. 这些发现表明模型将指令处理为社会行为而非技术规范:"NEVER do X" 是权威的行使,力度随语言而异;"X: disabled" 是可跨语言传递的事实描述. 若寄存器在推理时调节指令跟随,推论其在训练时亦如此. 我们将此表述为可检验的预测:以命令体态撰写的宪法 AI 原则可能在语言上产生依赖性的对齐.

关键词

引用

@article{arxiv.2603.25015,
  title  = {Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models},
  author = {Tony Mason},
  journal= {arXiv preprint arXiv:2603.25015},
  year   = {2026}
}