中文

Genie:在基于内容的数据集生成中实现人类水平

计算与语言 2024-01-26 v1 人工智能 机器学习

摘要

高质量内容生成任务数据的缺乏已被认为是阻碍这些任务发展的主要障碍。为了弥补这一差距,我们提出了Genie,一种自动生成高质量内容数据的新方法。它包含三个阶段:(a)内容准备,(b)生成:从内容中创建任务特定的示例(例如,问答对或摘要),(c)过滤机制,旨在确保生成数据的质量和忠实度。我们通过生成三个大规模合成数据来展示这种方法,为长式问答(LFQA)、摘要和信息提取生成数据。在人类评估中,我们发现生成的数据是自然的且高质量的。此外,我们将使用我们数据训练的模型与使用人类编写数据训练的模型进行了比较——LFQA使用ELI5和ASQA,摘要使用CNN-DailyMail。我们表明,我们的模型与使用人类生成数据训练的模型性能相当或更优,并且在忠实度方面始终优于它们。最后,我们应用我们的方法创建了医学领域的LFQA数据,并将使用该数据训练的模型与使用其他领域数据训练的模型进行了比较。

关键词

引用

@article{arxiv.2401.14367,
  title  = {Genie: Achieving Human Parity in Content-Grounded Datasets Generation},
  author = {Asaf Yehudai and Boaz Carmeli and Yosi Mass and Ofir Arviv and Nathaniel Mills and Assaf Toledo and Eyal Shnarch and Leshem Choshen},
  journal= {arXiv preprint arXiv:2401.14367},
  year   = {2024}
}

备注

Accepted to ICLR24