虚假不动点: 大语言模型中的康德式反馈、稳定校准误差与表征压缩
人工智能
2026-05-26 v4 计算与语言
机器学习
摘要
大型语言模型中的高置信度错误通常被视为脆弱的失败。我们研究另一种可能性:某些错误可能是虚假不动点,即局部稳定、内部一致且自信地错误。这区分了鲁棒性与真理追踪。我们通过一个康德式承诺门控框架和一个最小线性反馈模型来发展这种区分,在该模型中稳定性和正确性可能发生分歧。在三个开放权重模型上,根据我们的隐藏状态敏感性探测,过度自信的错误项并不比自信正确的项在局部上更脆弱。基于弃权的自我批评通过牺牲覆盖率来减少过度自信的错误承诺,而C3-R(一种基于规则的显式反馈门控)则加剧了这种权衡,而非消除它。这些结果激发(但未证实)高信噪比惯性和表征压缩作为稳定校准误差的可能机制。
引用
@article{arxiv.2510.14925,
title = {False Fixed Points: Kantian Feedback, Stable Miscalibration, and Representational Compression in LLMs},
author = {Akira Okutomi},
journal= {arXiv preprint arXiv:2510.14925},
year = {2026}
}
备注
27 pages, 8 figures, v3.0