大型语言模型自锚定校准漂移:多轮对话如何重塑模型置信度
计算与语言
2026-03-03 v1 人工智能
摘要
我们提出自锚定校准漂移(Self-Anchoring Calibration Drift, SACD),这是一种假设性现象,即大型语言模型(LLMs)在跨越多轮对话中反复建立在自身先前输出之上的情形时,会表现出系统性的置信度表达变化。我们报告了一项实证研究,比较了三种前沿模型——Claude Sonnet 4.6、Gemini 3.1 Pro和GPT-5.2——在150个问题上的表现,这些问题涵盖事实性、技术性和开放性领域,使用三种条件进行测试:单轮基线(A)、多轮自锚定(B)和独立重复控制(C)。结果揭示了一种复杂且具有模型异质性的模式,这部分偏离了预先注册的假设。Claude Sonnet 4.6在自锚定条件下表现出显著的置信度下降(平均CDS = -0.032, t(14) = -2.43, p = .029, d = -0.627),同时也表现出显著的校准误差漂移(F(4,56) = 22.77, p < .001, η² = .791)。GPT-5.2在开放性领域显示出相反的模式(平均CDS = +0.026),并在第5轮出现显著的ECE升级。Gemini 3.1 Pro未显示出显著的CDS(t(14) = 0.38, p = .710),但其条件C数据揭示了令人惊讶的ECE模式:在没有自锚定的情况下,Gemini的校准误差从.327降至接近零,而自锚定保持ECE基本稳定在约.333——这表明SACD可以表现为对自然校准改善的抑制,而非单纯的增加。
引用
@article{arxiv.2603.01239,
title = {Self-Anchoring Calibration Drift in Large Language Models: How Multi-Turn Conversations Reshape Model Confidence},
author = {Harshavardhan},
journal= {arXiv preprint arXiv:2603.01239},
year = {2026}
}