中文

“我可能没有把我的想法表达得很清楚”:诊断 LLM 推理时动态不稳定性

人工智能 2026-02-04 v1 机器学习

摘要

大型语言模型(LLM)中的推理失效通常仅在生成结束时进行测量,但许多失效在模型“中途丢失思路”时便已显现。我们研究此类中断能否通过标准 API 中可获得的推理时信标(如 token 对数概率)进行检测——无需任何训练或微调。我们定义一种简单信号,将连续步骤分布性变化(JSD)和不确定性(熵)相结合,对每条轨迹按其峰值不稳定强度进行汇总,并展示该信号可可靠预测失效。在 GSM8K 和 HotpotQA 上,不稳定性强度以优于随机的 AUC 预测错误答案,并在模型规模跨越不同规模时表现出单调的分段准确率下降。关键的是,我们指出不稳定性并非始终有害:早期不稳定可反映后续稳定化及正确最终答案(“纠正性不稳定”),而晚期不稳定更常伴随失效(“破坏性不稳定”),即便在相同峰值强度下也如此,表明可恢复性不仅取决于分布变化的强度,也取决于此类变化相对于剩余解码时程的发生时间。该方法具有模型中立性、训练无关性和可复现性,本文将其作为诊断视角呈现,而非纠正或控制机制。

关键词

引用

@article{arxiv.2602.02863,
  title  = {"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time},
  author = {Jinkun Chen and Fengxiang Cheng and Sijia Han and Vlado Keselj},
  journal= {arXiv preprint arXiv:2602.02863},
  year   = {2026}
}

备注

21 pages, 12 figures, 15 tables