检测-提取间隙:模型在能说出答案前已知答案
计算与语言
2026-04-10 v2 人工智能
信息论
机器学习
math.IT
摘要
现代推理模型持续生成长文本,直到答案已被确定。我们在五种模型配置、两个家族和三个基准测试中发现,52--88% 的链式思维 token 在答案可从部分前缀中恢复后才被生成。这种 post-commitment 生成揭示了一种结构性现象:检测-提取间隙。来自早期前缀的自由 continuation 可在仅占轨迹 10% 时恢复正确答案,而受强制提取限制则在 42% 的情况下失败。答案可从模型状态中恢复,但基于提示的解码未能提取它。我们通过在自由和强制 continuation 分布之间建立总变差界来正式化这一不匹配,从而对后缀引起的偏移量进行定量估计。利用这种不对称性,我们提出 Black-box Adaptive Early Exit (BAEE),其使用自由 continuation 进行检测和提取,在截断 70--78% 的串行生成的同时,通过 1--5pp 的准确率提升适用于所有模型。对于 thinking-mode 模型,early exit 可防止 post-commitment 覆盖,提升最高可达 5.8pp;一种成本优化变体在中位数仅 9 个 API 调用的情况下实现 68--73% 的减少。代码已公开于 https://github.com/EdWangLoDaSc/know2say。
引用
@article{arxiv.2604.06613,
title = {The Detection-Extraction Gap: Models Know the Answer Before They Can Say It},
author = {Hanyang Wang and Mingxuan Zhu},
journal= {arXiv preprint arXiv:2604.06613},
year = {2026}
}