中文

小型大语言模型的零样图置信度估计:监督基线训练价值不值得

人工智能 2026-05-08 v3 计算与语言 新兴技术

摘要

小型语言模型能否可靠地估计自身正确性——这决定了是否需要监督训练数据即可实现本地到云端的路由升级(即将无法由廉价本地模型处理的查询转到高成本云端)。随着推理成本在大型语言模型(LLM)部署预算中占据主导地位,将大部分查询路由到廉价本地模型,仅将难题交给昂贵的云端调用已成为日益常见的成本控制策略。我们在三个7-8B模型系列上,对比了零样图置信度信号与RouteLLM风格的监督基线,在两个数据集上分别进行1000和500个查询的测试。平均token对数概率(无需训练数据)在分布内(ROC曲线下面积(AUROC)0.650-0.714)与监督基线(0.644-0.676)持平或更好,在分布外(0.717-0.833 vs. 0.512-0.564)则显著优于后者,因为它衡量的是模型生成的属性而非查询分布。本文进一步提出了检索条件自我评估,这是一种生成前信号,通过在相似度较高时有选择性地注入检索到的知识,在不使用对数概率的前提下提升约+0.069的AUROC,且延迟仅为对数概率的3-10倍。在1000个标记示例上训练的监督基线从未超过零样图信号。我们发布了所有代码、数据和实验日志。

关键词

引用

@article{arxiv.2605.02241,
  title  = {Zero-Shot Confidence Estimation for Small LLMs: When Supervised Baselines Aren't Worth Training},
  author = {Luong N. Nguyen},
  journal= {arXiv preprint arXiv:2605.02241},
  year   = {2026}
}