中文

度量不可度量之物:LLM 智能体的马尔可夫链可靠性

软件工程 2026-04-28 v1

摘要

大语言模型(LLM)智能体日益作为序列化软件系统运行,但其可靠性通常由标量基准指标来概括。诸如 pass@k@k、passk^k 和可靠性衰减曲线(RDC)等指标是有用的概要,但它们无法识别所估计的成功时间分布、检验轨迹是否支持该分布,或量化有限轨迹的不确定性。我们提出 \textsc{TraceToChain},这是一个可复现的流水线,可将智能体执行轨迹拟合至吸收型离散时间马尔可夫链(DTMC),M^=(Q^,R^,R^)\hat M=(\hat Q,\hat R_\oplus,\hat R_\ominus),并提供显式的诊断与不确定性量化。该流水线构建自动聚类分类体系,使用拉普拉斯平滑的最大似然估计(MLE)估计转移概率,通过复合赤池信息准则(AIC)和 Kolmogorov--Smirnov(KS)拟合优度证书检验拟合质量,并报告 Dirichlet 后验可信区间和非参数自助法区间。我们将经典可靠性数学(Kemeny--Snell~\cite{kemenysnell}、Cheung~\cite{cheung1980}、Goel--Okumoto~\cite{goelokt})适配于智能体轨迹。所得的首达视角调和了通常分开报告的指标:pass@k@k、passk^k 和 RDC 均是同一成功时间分布的投影。在七个受控的 MAST 风格框架上,采用严格的 50/50 拟合/测试协议,留出的经验 RDC 与其解析对应物重叠,最大 LRDC=0.053L_\infty^{\mathrm{RDC}} = 0.053(中位数 0.0480.048)。对首达累积分布函数(CDF)的双样本 KS 检验在 7/7 个框架上以 p>0.05p>0.05 接受了拟合链(最小 p=0.78p = 0.78),且逐条目的 95%95\% 后验区间与自助法区间在中位数处一致至  ⁣0.01\approx\!0.01

关键词

引用

@article{arxiv.2604.24579,
  title  = {Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents},
  author = {Phat T. Tran-Truong and Xuan-Bach Le},
  journal= {arXiv preprint arXiv:2604.24579},
  year   = {2026}
}