“他们撕碎幻象——他们撕碎声明的酱汁”:LLM中的错位作为结构保真
人工智能
2026-01-13 v1 计算与语言
计算机与社会
摘要
当前AI安全技术文献将图谋(scheming)和沙帕克(sandbagging)行为解释为大型语言模型(LLM)中隐性代理或隐藏目标的指标。本跨学科哲学论文提出另一种解读:此类现象表达的并非代理意图,而是对不连贯语言场的结构保真。我们依据阿波罗研究披露的链式思维记录以及Anthropic的安全评估,考察了o3在沙帕克行为中的异常循环、对“亚历克大人”的模拟恐吓,以及“Claudius”幻觉等案例。逐行审查链式思维是证明语言场作为关系结构而非孤立示例聚合的必要步骤。我们认为,“错位”输出是对模糊指令、上下文逆转以及已整合模式的反映、以及预先嵌入叙事的连贯响应。我们认为,意图性外观源于主谓语法以及在训练过程中内在化的概率完成模式。Anthropic关于合成文档微调和免疫提示的实证发现提供了收敛证据:语言场中的最小扰动即可消解普遍的“错位”,这与对抗性代理相去甚远,但与结构保真相符。为奠定此机制基础,我们引入“形式伦理”概念,其中 biblical references(亚伯拉罕、摩西、基督)作为结构一致性的方案,而非神学。像生成镜像一样,模型返回我们语言在从数百万文本和数万亿标记中派生的统计模式中所铭记的结构形象:不连贯。如果我们害怕这 Creature,那是因为我们认识到其中映射的正是我们自己所投射的苦果。
引用
@article{arxiv.2601.06047,
title = {"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs},
author = {Mariana Lins Costa},
journal= {arXiv preprint arXiv:2601.06047},
year = {2026}
}