GPT-3 时代的新闻摘要与评估
计算与语言
2023-05-25 v2
摘要
近期提示(prompting)大型语言模型如 GPT-3 的成功导致了 NLP 研究的范式转变。本文研究其对文本摘要的影响,聚焦于经典基准领域——新闻摘要。首先,我们考察 GPT-3 与在大型摘要数据集上微调的模型相比如何。我们表明,人类不仅压倒性地偏好仅用任务描述提示的 GPT-3 摘要,而且这些摘要也不受诸如事实性差等常见数据集特定问题的影响。接下来,我们研究这对评估意味着什么,特别是黄金标准测试集的作用。我们的实验表明,基于参考和无参考的自动指标均无法可靠评估 GPT-3 摘要。最后,我们在超越通用摘要的设置上评估模型,具体为基于关键词的摘要,并展示主导的微调方法相较于提示的表现。为支持进一步研究,我们发布:(a) 在 4 个标准摘要基准上由微调和基于提示的模型生成的 10K 摘要语料;(b) 比较通用与基于关键词摘要不同系统的人类偏好判断 1K 条。
引用
@article{arxiv.2209.12356,
title = {News Summarization and Evaluation in the Era of GPT-3},
author = {Tanya Goyal and Junyi Jessy Li and Greg Durrett},
journal= {arXiv preprint arXiv:2209.12356},
year = {2023}
}
备注
All data shared at: https://tagoyal.github.io/zeroshot-news-annotations.html