LitCab:面向短文本与长文本生成的轻量级语言模型校准
计算与语言
2024-03-14 v2
摘要
当模型的概率估计与其输出实际正确的可能性相一致时,该模型被视为校准良好。校准语言模型(LMs)至关重要,因其在检测与缓解LM幻觉以及构建更可信模型方面发挥着关键作用。然而,标准校准技术可能并不适用于LM校准。例如,温度缩放等后处理方法不会对候选生成重排序。另一方面,基于训练的方法需微调整个模型,这对大规模LM而言不切实际。我们提出LitCab,一种轻量级校准机制,由单层线性层构成,该层接收输入文本表示并预测偏置项,随后将其加至LM输出logits。LitCab仅增加少于2%的原始模型参数即改善模型校准。为评估,我们构建了CaT,一个由八项文本生成任务组成的基准,涵盖从短短语到段落的响应。我们用Llama2-7B测试LitCab,其在所有任务上均改善校准,将平均ECE分数降低至多30%。我们进一步使用来自GPT与LLaMA系列多个流行开源LM进行全面评估,得到以下关键发现:(i)同一系列中较大模型在短生成任务上展现更好校准,但对较长生成未必如此。(ii)GPT系列模型相较LLaMA、Llama2与Vicuna模型展现更优校准,尽管参数少得多。(iii)用有限用途样本(如对话)微调预训练模型(如LLaMA)可能导致更差校准,凸显微调设置对LM校准的重要性。
引用
@article{arxiv.2310.19208,
title = {LitCab: Lightweight Language Model Calibration over Short- and Long-form Responses},
author = {Xin Liu and Muhammad Khalifa and Lu Wang},
journal= {arXiv preprint arXiv:2310.19208},
year = {2024}
}
备注
accepted to ICLR 2024