中文

Martingale得分:用于LLM推理中贝叶斯理性的无监督度量

人工智能 2025-12-03 v1 计算与语言 机器学习

摘要

近期推理技术的进展显著提升了大语言模型(LLMs)的性能,提高了对其提供准确、真实可靠信息的期望。然而,新证据表明,迭代推理可能加剧信念固化和确认偏误,而非提升真相寻求行为。本研究提出了一种基于贝叶斯统计中Martingale性质的系统性评估框架,用于衡量LLM推理中的信念固化。该性质表明,在合理的信念更新下,未来信念的期望值应等于当前信念,即信念更新不可从当前信念中预测。我们提出了一种无监督、基于回归的Martingale得分,用于衡量该性质的违反程度,这些违背行为信号化偏离了贝叶斯更新新证据的能力。在包括事件预测、价值观问题和学术论文评审等开放性问题领域中,我们发现这些违背在不同模型和设置下普遍存在,其中当前信念正预测未来信念更新,我们称之为信念固化。我们识别了更易发生信念固化的模型、推理技术和领域。最后,我们通过在可获得真实标签的问题领域中表明该得分能预测准确性来验证Martingale得分。这表明,虽然该得分设计为无监督度量,且即使在没有真实标签的领域中也能操作,但Martingale得分是寻求真相推理过程的有用指标。

关键词

引用

@article{arxiv.2512.02914,
  title  = {Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning},
  author = {Zhonghao He and Tianyi Qiu and Hirokazu Shirado and Maarten Sap},
  journal= {arXiv preprint arXiv:2512.02914},
  year   = {2025}
}

备注

NeurIPS 2025