中文

文本生成:任务、评估与挑战的系统文献综述

计算与语言 2024-09-02 v3

摘要

文本生成已经变得比以往任何时候都更加容易获得,对这些系统(尤其是使用大型语言模型的系统)的兴趣日益增长,刺激了相关出版物的增加。我们提供了一项系统文献综述,包括2017年至2024年间选定的244篇论文。本综述将文本生成的工作分为五个主要任务:开放式文本生成、摘要、翻译、释义和问答。对于每个任务,我们回顾了它们的相关特征、子任务和具体挑战(例如,多文档摘要缺少数据集、故事生成的连贯性以及问答的复杂推理)。此外,我们评估了当前评估文本生成系统的方法,并确定了当前指标的问题。我们的调查显示,在最近的文本生成出版物中,所有任务和子任务共有的九个突出挑战:偏见、推理、幻觉、误用、隐私、可解释性、透明度、数据集和计算。我们详细分析了这些挑战、它们的潜在解决方案,以及哪些差距仍需要社区进一步参与。本系统文献综述针对两个主要受众:自然语言处理领域的早期职业研究人员,他们希望了解该领域的概况和有前景的研究方向;以及经验丰富的研究人员,他们希望详细了解任务、评估方法、开放挑战和最近的缓解策略。

关键词

引用

@article{arxiv.2405.15604,
  title  = {Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges},
  author = {Jonas Becker and Jan Philip Wahle and Bela Gipp and Terry Ruas},
  journal= {arXiv preprint arXiv:2405.15604},
  year   = {2024}
}

备注

35 pages, 2 figures, 2 tables, Under review