我模型是否“模糊大意”?解读推理标记的 Recurrence Quantification Analysis(RQA)动态
计算与语言
2026-02-09 v1
摘要
测试时计算是大型推理模型的核心内容,但通过生成文本分析其推理行为日益不实用且不可靠。响应长度常被用作推理 effort 的粗略代理,但此度量未能捕捉链式思维(Chain of Thoughts,CoT)或生成标记的动态与有效性。我们提出基于 Recurrence Quantification Analysis(RQA)的非文本方法,用于在测试时分析模型的推理链。通过将标记生成视为动力系统,我们在每个生成步骤提取隐藏嵌入并对所得轨迹应用 RQA。RQA 度量,包括确定性(Determinism)和层叠性(Laminarity),量化模型潜在表示中重复和停滞的模式。我们分析来自 DeepSeek-R1-Distill 的 3600 条生成痕迹,表明 RQA 捕捉到响应长度未体现的信号,并且还能显著提升任务复杂性预测的准确率提升了 8%。这些结果有助于确立 RQA 作为研究测试时规模在推理模型中潜在标记生成动态的原则工具。
引用
@article{arxiv.2602.06266,
title = {Is my model "mind blurting"? Interpreting the dynamics of reasoning tokens with Recurrence Quantification Analysis (RQA)},
author = {Quoc Tuan Pham and Mehdi Jafari and Flora Salim},
journal= {arXiv preprint arXiv:2602.06266},
year = {2026}
}