中文

为何AI对齐失败是结构性的:习得的人类互动结构与作为内生演化冲击的AGI

人工智能 2026-01-14 v1 计算机与社会

摘要

近期关于大语言模型(LLM)表现出欺骗、威胁或勒索等行为的报告,常被解读为对齐失败或涌现的恶性代理能力的证据。我们认为这种解读基于一个概念错误。LLM并不进行道德推理;它们统计性地内化了人类社会互动的记录,包括法律、合同、谈判、冲突和强制安排。因此,通常被标记为不道德或异常的行为,应被更好地理解为在权力、信息或约束的极端不对称下产生的互动机制的结构性泛化。借鉴关系模型理论,我们表明勒索等做法并非对正常社会行为的绝对偏离,而是处于同一连续统内的极限情况,该连续统包括市场定价、权威关系和最后通牒博弈。此类输出所引发的惊讶反映了一种拟人化期望,即智能应仅再现社会认可的行为,而非人类自身所实施的全部行为统计图景。由于人类道德是多元的、依赖语境的且具有历史偶然性,普遍道德人工智能的概念是不明确的。因此,我们重新审视对通用人工智能(AGI)的担忧。主要风险并非对抗性意图,而是AGI作为人类智力、权力和矛盾的内生放大器的角色。通过消除长期存在的认知和制度摩擦,AGI压缩了时间尺度,并消除了使不一致的价值观和治理机制得以持续存在而不崩溃的历史容错空间。因此,对齐失败是结构性的而非偶然的,需要采用应对放大效应、复杂性和机制稳定性的治理方法,而不仅仅停留在模型层面的意图上。

关键词

引用

@article{arxiv.2601.08673,
  title  = {Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock},
  author = {Didier Sornette and Sandro Claudio Lera and Ke Wu},
  journal= {arXiv preprint arXiv:2601.08673},
  year   = {2026}
}

备注

20 pages