大型语言模型是校准不足的上下文学习者
计算与语言
2025-05-23 v3 人工智能
机器学习
摘要
在适应带有或不带有微调的上下文学习(ICL)时,我们好奇指令微调后的语言模型是否能够在不遭受过度自信(即校准不足)问题的情况下实现良好校准的结果,考虑到其强大的指令遵循能力,尤其是在如此有限的数据设置下。在本工作中,我们从性能和校准两个角度,深入分析了不同学习方法选择下的行为。通过广泛的对照实验,我们观察到在低资源设置下,所有学习方法均存在校准不足问题。为了同时获得任务内性能和校准的提升,我们随后研究了在不同建模阶段(例如上下文示例的变化、提示的变化或不同的集成策略)应用自集成(self-ensembling)的潜力,以使预测更加校准并具有可比性甚至更好的性能。我们发现,采用最大概率的自集成能产生鲁棒且校准良好的预测。我们的工作揭示了尽管任务性能有所提升,但使用 ICL 仍存在潜在的校准问题,并阐明了应选择何种学习范式。我们还提供了根据模型此前是否见过数据来选择学习范式的实用指南,以及通过自集成来同时增强语言模型任务性能和校准的有价值解决方案,我们希望这能鼓励进一步的研究。
引用
@article{arxiv.2312.13772,
title = {Large Language Models are Miscalibrated In-Context Learners},
author = {Chengzu Li and Han Zhou and Goran Glavaš and Anna Korhonen and Ivan Vulić},
journal= {arXiv preprint arXiv:2312.13772},
year = {2025}
}
备注
9 pages, 4 figures, 5 tables (20 pages, 5 figures, 13 tables including references and appendices)