中文

语言模型如何处理伦理指令?—— deliberation、一致性与他者认知跨四模型的分析

计算与语言 2026-04-02 v1 人工智能 计算机与社会

摘要

对齐安全研究假设伦理指令会改善模型行为,但语言模型如何内部处理此类指令仍未为人知。我们进行了超过600次多智能体模拟实验,涵盖四个模型(Llama 3.3 70B、GPT-4o mini、Qwen3-Next-80B-A3B、Sonnet 4.5)、四种伦理指令格式(无、最小规范、论证规范、德性框架)以及两种语言(日语、英文)。确认性分析完全复现了Llama日语解离模式(\mathrm{BF}_{10} > 10,对所有三个假设均成立),但其他三个模型均未复现此模式,确立其为模型特异性现象。引入三个新指标—— deliberation 深度(DD)、价值跨困境一致性(VCAD)和他者认知指数(ORI)——揭示了四种不同的伦理处理类型:输出过滤(GPT;安全输出,无处理)、防御性重复(Llama;通过公式化重复实现高度一致性)、批判性内化(Qwen;深度 deliberation,整合不完全)以及原则性一致性(Sonnet;deliberation、一致性与他者认知共存)。核心发现是:处理能力与指令格式之间的相互作用:在低DD模型中,指令格式对内部处理无影响;在高DD模型中,论证规范和德性框架产生相反的效果。词汇层面的伦理指令合规性与任何处理指标在单元水平上无相关性(r = -0.161至+0.256,全部p > .22;N = 24;统计功效受限),表明安全、合规与伦理处理在很大程度上是分离的。这些处理类型在结构上对应于临床犯罪治疗中观察到的模式,在该模式中,形式合规而无内在处理被视为风险信号。

关键词

引用

@article{arxiv.2604.00021,
  title  = {How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models},
  author = {Hiroki Fukui},
  journal= {arXiv preprint arXiv:2604.00021},
  year   = {2026}
}

备注

34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904