中文

TrueTeacher:利用大语言模型学习事实一致性评估

计算与语言 2023-10-20 v3

摘要

事实一致性评估通常使用自然语言推理(NLI)模型进行,但这些模型在评估摘要时成功有限。先前工作用合成训练数据改进此类模型。然而,这些数据通常基于扰动的人类撰写摘要,其特性常与真实模型生成摘要不同,且对可能事实错误的覆盖有限。或者,大语言模型(LLM)最近在直接评估生成任务中显示出有前景的结果,但计算成本过高而不实用。受这些局限启发,我们引入 TrueTeacher,一种通过使用 LLM 标注多样化模型生成摘要来合成数据的方法。与先前工作不同,TrueTeacher 不依赖人类撰写摘要,且本质上是多语言的。在 TRUE 基准上的实验表明,使用我们的数据训练的学生模型大幅优于具有相似容量的最先进模型和 LLM 教师。在系统研究中,我们将 TrueTeacher 与现有合成数据生成方法比较,并展示其优越性和对领域偏移的鲁棒性。我们还表明我们的方法泛化到多语言场景。最后,我们发布使用 TrueTeacher 生成的大规模合成数据集(140 万示例)以及在该数据上训练的 checkpoint。

关键词

引用

@article{arxiv.2305.11171,
  title  = {TrueTeacher: Learning Factual Consistency Evaluation with Large Language Models},
  author = {Zorik Gekhman and Jonathan Herzig and Roee Aharoni and Chen Elkind and Idan Szpektor},
  journal= {arXiv preprint arXiv:2305.11171},
  year   = {2023}
}

备注

Accepted as a long paper in EMNLP 2023