中文

GPT-3 时代的新闻摘要与评估

计算与语言 2023-05-25 v2

摘要

近期提示(prompting)大型语言模型如 GPT-3 的成功导致了 NLP 研究的范式转变。本文研究其对文本摘要的影响,聚焦于经典基准领域——新闻摘要。首先,我们考察 GPT-3 与在大型摘要数据集上微调的模型相比如何。我们表明,人类不仅压倒性地偏好仅用任务描述提示的 GPT-3 摘要,而且这些摘要也不受诸如事实性差等常见数据集特定问题的影响。接下来,我们研究这对评估意味着什么,特别是黄金标准测试集的作用。我们的实验表明,基于参考和无参考的自动指标均无法可靠评估 GPT-3 摘要。最后,我们在超越通用摘要的设置上评估模型,具体为基于关键词的摘要,并展示主导的微调方法相较于提示的表现。为支持进一步研究,我们发布:(a) 在 4 个标准摘要基准上由微调和基于提示的模型生成的 10K 摘要语料;(b) 比较通用与基于关键词摘要不同系统的人类偏好判断 1K 条。

关键词

引用

@article{arxiv.2209.12356,
  title  = {News Summarization and Evaluation in the Era of GPT-3},
  author = {Tanya Goyal and Junyi Jessy Li and Greg Durrett},
  journal= {arXiv preprint arXiv:2209.12356},
  year   = {2023}
}

备注

All data shared at: https://tagoyal.github.io/zeroshot-news-annotations.html