中文

大型语言模型必须学习认识自身的局限性

机器学习 2025-08-19 v3 人工智能 计算与语言 机器学习

摘要

在高风险应用中使用大型语言模型(LLM)时,我们需要了解何时可以信任其预测。一些研究认为,通过提示(prompting)高性能 LLM 即可产生校准的不确定性,而另一些研究则提出采样方法,但代价昂贵。本文首先论证,仅靠提示方法不足以实现良好的校准,然后展示,通过在小数据集上微调正确与错误答案,即可创建出具备良好泛化能力且计算开销小的不确定性估计。我们表明,仅需一千个标记样本即可超越基线方法,并且通过模型特征进行训练是获得好性能且在使用 LoRA 处理大型开源模型时可行的必要条件。我们还探讨了实现可靠 LLM 不确定性估计的机制,发现许多模型可作为通用不确定性估计器,不仅适用于其自身的不确定性,也适用于其他模型的不确定性。最后,我们通过用户研究表明,不确定性估计能为人类在人机协作场景中的 LLM 使用提供指导。

关键词

引用

@article{arxiv.2406.08391,
  title  = {Large Language Models Must Be Taught to Know What They Don't Know},
  author = {Sanyam Kapoor and Nate Gruver and Manley Roberts and Katherine Collins and Arka Pal and Umang Bhatt and Adrian Weller and Samuel Dooley and Micah Goldblum and Andrew Gordon Wilson},
  journal= {arXiv preprint arXiv:2406.08391},
  year   = {2025}
}

备注

NeurIPS 2024 Camera Ready