面向大语言模型推理的Token级不确定性估计框架TokUR
机器学习
2026-04-14 v4 人工智能
计算与语言
摘要
尽管大语言模型(LLM)已在各类应用场景中展现出惊人能力,但其输出质量在不同情境下呈现显著不一致,导致难以识别可信响应,尤其是在需要多步推理的复杂任务中。本文提出一种面向推理的Token级不确定性估计框架TokUR,使LLM能够自我评估和自我改进其响应。在TokUR中,我们引入低秩随机权重扰动于LLM解码过程中,以生成token级不确定性估计的预测分布,并将这些不确定性量化以捕获生成响应的语义不确定性。在不同难度的数学推理数据集上实验表明,TokUR与答案正确性和模型鲁棒性呈强相关性,TokUR产生的不确定性信号可被用于在测试时提升模型推理性能。这些结果凸显了TokUR作为提升LLM在挑战性推理任务中可靠性和可解释性的有效方法。
关键词
引用
@article{arxiv.2505.11737,
title = {TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning},
author = {Tunyu Zhang and Haizhou Shi and Yibin Wang and Hengyi Wang and Xiaoxiao He and Zhuowei Li and Haoxian Chen and Ligong Han and Kai Xu and Huan Zhang and Dimitris Metaxas and Hao Wang},
journal= {arXiv preprint arXiv:2505.11737},
year = {2026}
}
备注
Accepted to International Conference on Learning Representations (ICLR) 2026