大语言模型推理中可观测信念修订的α-定律
计算与语言
2026-03-23 v1 人工智能
摘要
大语言模型(Large Language Models, LLMs)通过链式思考推理、自我反思或多智能体辩论等机制不断修订其输出,缺乏关于其概率更新稳定性的原则性保证。我们识别出一种一致的乘法标度定律,规定了经指令调优LLMs在候选答案上的概率分配如何进行修订,表达为一种控制先前信念与验证证据在更新期间如何组合的信念修订指数。我们在理论上表明,指数小于1是渐近稳定性的必要且充分条件。在经4,975个问题跨越研究生水平基准(GPQA Diamond、TheoremQA、MMLU-Pro和ARC-Challenge)以及多个模型家族(GPT-5.2和Claude Sonnet 4)的实证评估中,结果显示模型接近贝叶斯更新行为,在单步修订中模型运行略高于稳定性边界。然而,多步实验表明,指数在连续修订中会降低,产生符合理论稳定性预测的收缩长期动态。针对Llama-3.3-70B的token级验证进一步确认了类似的行为,无论是基于对数概率测量还是基于自我报告的置信度寻求,都显示出类似行为。分析更新组成部分揭示了特定于架构的信任比模式,其中GPT-5.2显示先前信念与证据之间的平衡加权,而Claude则稍微偏向新证据。本工作表征可观测的推理时间更新行为,而非内部贝叶斯推理,并引入α-定律作为监控更新稳定性和推理质量的原则性诊断工具。
引用
@article{arxiv.2603.19262,
title = {The {\alpha}-Law of Observable Belief Revision in Large Language Model Inference},
author = {Mike Farmer and Abhinav Kochar and Yugyung Lee},
journal= {arXiv preprint arXiv:2603.19262},
year = {2026}
}
备注
24 pages, 13 figures, 10 tables