语言模型训练中的真理:压缩性误差的一种解释
计算与语言
2026-04-07 v3 人工智能
摘要
为何在矛盾数据上训练的语言模型倾向于选择正确答案?在小型变换器(350 万至 860 万参数)的受控实验中,我们展示了这种偏好跟随错误的压缩性结构,而非真理本身。我们在包含正确与错误解答的数学问题语料库上训练 GPT-2 风格模型——这是一种直接建模相同事实 conflicting 信息的去噪设计。当错误为随机时,模型以 65% 至 85% 的准确率提取正确信号;当错误遵循连贯的替代规则系统时,准确率下降至接近随机水平(~45%--51%):模型无法区分虚假系统与真理。多规则实验揭示了明显的临界点:单一连贯的替代规则完全消除真理偏好,但加入第二个竞争性规则后,偏好大幅恢复(47%→78%),并随规则数量增至 N=10 时达到 88%。相同模式在真实维基百科文本上也得到复现(71% vs 46%)。我们提出压缩-一致性原理作为解释性假设:在这些情境下,梯度下降偏好最易压缩的答案簇,而非真理本身。只有当虚假信息结构不连贯时,真理偏好才会出现。是否将该原理推广到大规模预训练仍是未知之谜。
引用
@article{arxiv.2603.11749,
title = {Truth as a Compression Artifact in Language Model Training},
author = {Konstantin Krestnikov},
journal= {arXiv preprint arXiv:2603.11749},
year = {2026}
}
备注
v3: Added Qwen3 architecture check (0.6B), ~1B experiment on FineWeb-Edu, generative eval at all scales, matched-random ablation. Formal MDL predictions. Softened claims, fixed bibliography, added NeurIPS checklist. 210+ models (was 160+)