度量不可度量之物:LLM 智能体的马尔可夫链可靠性
软件工程
2026-04-28 v1
摘要
大语言模型(LLM)智能体日益作为序列化软件系统运行,但其可靠性通常由标量基准指标来概括。诸如 pass、pass 和可靠性衰减曲线(RDC)等指标是有用的概要,但它们无法识别所估计的成功时间分布、检验轨迹是否支持该分布,或量化有限轨迹的不确定性。我们提出 \textsc{TraceToChain},这是一个可复现的流水线,可将智能体执行轨迹拟合至吸收型离散时间马尔可夫链(DTMC),,并提供显式的诊断与不确定性量化。该流水线构建自动聚类分类体系,使用拉普拉斯平滑的最大似然估计(MLE)估计转移概率,通过复合赤池信息准则(AIC)和 Kolmogorov--Smirnov(KS)拟合优度证书检验拟合质量,并报告 Dirichlet 后验可信区间和非参数自助法区间。我们将经典可靠性数学(Kemeny--Snell~\cite{kemenysnell}、Cheung~\cite{cheung1980}、Goel--Okumoto~\cite{goelokt})适配于智能体轨迹。所得的首达视角调和了通常分开报告的指标:pass、pass 和 RDC 均是同一成功时间分布的投影。在七个受控的 MAST 风格框架上,采用严格的 50/50 拟合/测试协议,留出的经验 RDC 与其解析对应物重叠,最大 (中位数 )。对首达累积分布函数(CDF)的双样本 KS 检验在 7/7 个框架上以 接受了拟合链(最小 ),且逐条目的 后验区间与自助法区间在中位数处一致至 。
引用
@article{arxiv.2604.24579,
title = {Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents},
author = {Phat T. Tran-Truong and Xuan-Bach Le},
journal= {arXiv preprint arXiv:2604.24579},
year = {2026}
}