LLM 输出令人惊讶的普适性:一种实时验证原语
摘要
我们报告了前沿 LLM 输出中的一种显著统计规律性,它使得一种纯 CPU 评分原语能够以每 token 2.6 微秒的速度运行,其估计延迟比现有的基于采样的检测器低至多 100,000 倍(五个数量级)。在来自五个独立供应商的六个当代模型、两种生成规模和五个留出域中,token 排序-频率分布收敛于同一个双参数 Mandelbrot 排序分布,其中 36 个模型-域拟合中有 34 个超过 ,且 36 个中有 35 个根据 AIC 更倾向于 Mandelbrot 而非 Zipf。共享的分布族并未将模型坍缩为统计副本。拟合的 Mandelbrot 参数在模型之间保持清晰可分: 的跨模型分布范围(1.63 至 3.69)比其每模型 bootstrap 标准差(0.03 至 0.10)大超过一个数量级,在每数千个输出 token 中产生数十个标准差的分离。由此产生两项能力。首先是统计模型指纹识别:可以针对其声称的模型族测试来自供应商交付的 LLM 的文本,而无需密码学水印或访问模型内部,从而支持来源验证和静默替换审计。其次是用于黑盒输出评估的模型无关参考分布,由此我们推导出一种单次评分原语,该原语在可用时与模型对数概率组合,并退化为可在封闭 API 上使用的仅排序模式。在 FRANK、TruthfulQA 和 HaluEval 上的试点结果描绘了该原语有效的领域(词汇异常、不受支持的实体)及其在结构上无法发挥作用的领域(领域适当词汇中的推理错误)。我们将该原语定位为复合评估堆栈中的第一层分诊层,而非基于采样或源条件验证器的替代品。
引用
@article{arxiv.2604.25634,
title = {The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive},
author = {Alex Bogdan and Adrian de Valois-Franklin},
journal= {arXiv preprint arXiv:2604.25634},
year = {2026}
}
备注
25 pages, 6 figures, 6 tables, 37 references. Code and data: https://github.com/Evolutionairy-AI/Ranking-Inference