CoT-Kinetics:评估大语言模型推理过程的理论建模
人工智能
2025-05-20 v1 计算与语言
摘要
近期的大型推理模型(LRM)通过学习推理显著提升了大型语言模型的推理能力,在解决复杂任务方面表现出前景。LRM 通过显式生成推理轨迹和答案来解决需要复杂推理的任务。然而,仅凭答案的正确性来判断此类输出答案质量并不容易,因为仅考虑答案的正确性是不够的,推理轨迹的严谨性同样重要。逻辑上,若推理部分的严谨性较差,即使答案正确,也应降低对该答案的置信水平。现有方法尝试考虑推理部分,从而对整个输出答案进行联合评估,但其能力仍不够理想,无法充分反映推理与所得答案之间的因果关系。在本文中,受经典力学启发,我们提出一种建立 CoT-Kinetics 能量方程的新方法。具体而言,我们的 CoT-Kinetics 能量方程将由 LRM 内部变换层调节的 token 状态转换过程建模为受机械场约束的粒子动力学过程。CoT-Kinetics 能量为推理阶段的严谨性赋予一个标量评分,揭示给定评估后的推理所能获得的置信水平。因此,可以准确地衡量 LRM 的整体输出质量,而不再是粗糙的(例如正确或错误)判断。
引用
@article{arxiv.2505.13408,
title = {CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process},
author = {Jinhe Bi and Danqi Yan and Yifan Wang and Wenke Huang and Haokun Chen and Guancheng Wan and Mang Ye and Xun Xiao and Hinrich Schuetze and Volker Tresp and Yunpu Ma},
journal= {arXiv preprint arXiv:2505.13408},
year = {2025}
}