中文

大语言模型中下一词预测的保形预测集:平衡覆盖率保证与集合效率

计算与语言 2025-12-30 v1 人工智能

摘要

在高风险领域部署大语言模型(LLM)需要严格的量化不确定性,然而标准的softmax概率通常校准不佳。我们对自适应预测集(APS)在具有大词汇量(超过250,000个词元)的基于Transformer的模型中的下一词预测应用进行了系统研究。我们的核心贡献是识别出覆盖率-效率权衡:虽然朴素的保形预测实现了有效的覆盖率,但它产生的预测集包含数百个词元,使其失去信息量。我们提出了词汇感知保形预测(VACP),这是一个利用语义掩蔽和温度调整评分来减少有效预测空间,同时可证明地保持边际覆盖率的框架。在Gemma-2B上使用SQUAD和WikiText基准的实验表明,VACP实现了89.7%的经验覆盖率(目标为90%),同时将平均预测集大小从847个词元减少到4.3个词元——效率提高了197倍。我们提供了词汇缩减的理论分析,并发布了我们的实现以供复现。

关键词

引用

@article{arxiv.2512.22682,
  title  = {Conformal Prediction Sets for Next-Token Prediction in Large Language Models: Balancing Coverage Guarantees with Set Efficiency},
  author = {Yoshith Roy Kotla and Varshith Roy Kotla},
  journal= {arXiv preprint arXiv:2512.22682},
  year   = {2025}
}

备注

10 pages, 5 tables and 1 algorithm