中文

针对微调语言模型的对比错误归因

计算与语言 2023-07-12 v2

摘要

近期的研究已将噪声和错误标注数据确定为自然语言生成(NLG)任务中产生幻觉和不忠实输出的核心原因。因此,识别并移除这些样本是创建可靠 NLG 系统的关键开放挑战。在这项工作中,我们引入了一个框架,用于识别和移除导致不良输出(如文本摘要中的忠实性错误)的低质量训练实例。我们表明,现有的错误追踪方法(如基于梯度的影响度量)在检测 NLG 数据集中的忠实性错误时表现并不稳定。我们通过一种新的、基于对比的估计方法,将不良生成结果与人工修正的输出进行比较,从而克服了现有错误追踪方法的缺陷。我们提出的方法在具有已知真实标签的合成任务中,检测已知数据错误的平均精度均值达到了 0.93,显著优于现有方法。使用该方法并在清洗后的数据上重新训练模型,使得 NYT 数据集上的实体幻觉减少了 70%,E2E 数据集上的语义错误减少了 55%。

关键词

引用

@article{arxiv.2212.10722,
  title  = {Contrastive Error Attribution for Finetuned Language Models},
  author = {Faisal Ladhak and Esin Durmus and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2212.10722},
  year   = {2023}
}

备注

ACL 2023