延迟-响应理论模型:通过响应准确性和链式思维长度评估大语言模型
统计方法学
2025-12-12 v2 人工智能
应用统计
机器学习
摘要
大语言模型(LLM)的不断涌现 necessitates 有效的评估方法以指导下游应用和可操作的未来改进。项目反应理论(IRT)最近作为评估LLM响应准确性的有前景框架而浮现。除了简单的响应准确性之外,LLM的链式思维(CoT)长度是其推理能力的重要指示器。为利用CoT长度信息辅助LLM评估,我们提出延迟-响应理论(LaRT)通过引入潜在能力、潜在速度以及它们之间关键相关性参数来联合建模响应准确性和CoT长度。我们推导了高效估计算法并为population参数建立严格的可识别性结果,以确保估计的统计有效性。理论渐近分析和模拟研究表明,LaRT在潜在特征的估计准确性和置信区间长度方面优于IRT。一个关键发现是,在LaRT下,潜在能力的渐近估计精度在潜在能力和潜在速度相关时超过IRT。我们收集了来自多种LLM在流行基准数据集上的真实响应。LaRT的应用揭示了所有基准中潜在能力和潜在速度之间存在强负相关,难度更高的基准相关性更强。这一发现支持了更高推理能力与更慢速度和更长响应延迟相关的直觉。LaRTyield与IRT不同的LLM排名,并在多个关键评估指标中超越IRT,包括预测力、项目效率、排名有效性和LLM评估效率。代码和数据可在 https://github.com/Toby-X/Latency-Response-Theory-Model 提供。
引用
@article{arxiv.2512.07019,
title = {Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length},
author = {Zhiyu Xu and Jia Liu and Yixin Wang and Yuqi Gu},
journal= {arXiv preprint arXiv:2512.07019},
year = {2025}
}