我不知道:使用 [IDK] 标记对不确定性进行显式建模
机器学习
2024-12-10 v1 计算与语言
摘要
大型语言模型因捕获真实世界知识而在众多下游任务中表现出色。尽管近期进步显著,但这些模型仍容易产生常见的幻觉,导致生成不寻常且事实错误的文本。本文提出一种新颖的校准方法,用于缓解幻觉问题。我们向模型词汇表添加一个特殊的 [IDK]("我不知道")标记,并引入一个目标函数,将错误预测的概率质量转移到 [IDK] 标记上。这种方法允许模型在输出中显式表达不确定性。我们在多个模型架构和事实下游任务上评估了所提方法。我们发现,采用本方法训练的模型能够在以往会出错的地方表达不确定性,而仅损失少量编码的知识。我们进一步进行了多种方法变体的大量消融研究,并对该方法的精确召回率权衡进行了详细分析。
引用
@article{arxiv.2412.06676,
title = {I Don't Know: Explicit Modeling of Uncertainty with an [IDK] Token},
author = {Roi Cohen and Konstantin Dobler and Eden Biran and Gerard de Melo},
journal= {arXiv preprint arXiv:2412.06676},
year = {2024}
}
备注
Published at NeurIPS 2024