意图坍缩:语言模型推理的意图级指标
摘要
语言生成将一个丰富的高维内部状态映射到单个 token 序列。我们通过意图坍缩的视角研究这种多对一映射:从内部意图空间 I 到外部语言空间 L 的投影。我们引入三个基于成本、模型无关的指标,这些指标计算在意图坍缩前的状态 I 上:(i) 意图熵 Hint(I),(ii) 有效维数 deff(I),(iii) 可恢复性 Recov(I),其作为预测最终成功的探针 AUROC 加工。我们在模型(Mistral-7B、LLaMA-3.1-8B、Qwen-2.5-7B)和基准(GSM8K、ARC-Challenge、AQUA-RAT)之间进行 3x3 研究,比较基线、链式思考(CoT)和 babble 控制(每个单元格 n=200 项)。CoT 将平均准确率从 34.2% 提升至 47.3%(提升 13.1 个百分点),这主要来自 GSM8K 的大幅提升,但在 ARC-Challenge 上保持一致的下降。在模型之间,CoT 诱导不同的熵 regime 相对于基线,dH = Hint(CoT) - Hint(Base):Mistral 显示 dH < 0(较低熵 CoT),而 LLaMA 显示 dH > 0(较高熵 CoT),这凸显了 CoT 诱导的内部不确定性的异质性。最后,探针 AUROC 在部分设置中显著高于随机,且可以与行为准确率分离(例如,在 Qwen 的 ARC-Challenge 上,CoT 的 AUROC 较高但准确率较低),这表明虽然内部信号具有信息性,但在受限响应格式下并不总能可靠地转化为最终的离散决策。
引用
@article{arxiv.2601.01011,
title = {Intention Collapse: Intention-Level Metrics for Reasoning in Language Models},
author = {Patricio Vera},
journal= {arXiv preprint arXiv:2601.01011},
year = {2026}
}
备注
41 pages, 8 figures, 6 tables. Code: https://github.com/patriciomvera/intention-collapse-experiments