中文

USB:跨任务与领域的统一摘要基准

计算与语言 2023-12-05 v2 机器学习

摘要

尽管 NLP 社区已产生众多摘要基准,但尚无一个提供同时解决许多与控制性和可靠性相关的重要问题所需的丰富标注。我们引入了一个源自维基百科的基准,并辅以丰富的众包标注集,支持 88 个相互关联的任务:(i) 抽取式摘要;(ii) 生成式摘要;(iii) 基于主题的摘要;(iv) 将选定句子压缩为一行摘要;(v) 为摘要句提供证据;(vi) 预测摘要句的事实准确性;(vii) 识别摘要句中无依据的跨度;(viii) 纠正摘要中的事实错误。我们在此基准上比较了多种方法,发现对于多个任务,中等规模的微调模型始终优于大得多的少样本提示语言模型。对于事实性相关任务,我们还评估了现有的用于创建训练数据的启发式方法,发现在其上训练导致的性能比在少 20×20\times 的人类标注数据上训练更差。我们的文章取自 66 个领域,便于跨领域分析。在某些任务上,训练数据的数量比其来源领域更重要,而对于其他任务,即使在数据有限的情况下,专门在目标领域数据上训练也更有益。

关键词

引用

@article{arxiv.2305.14296,
  title  = {USB: A Unified Summarization Benchmark Across Tasks and Domains},
  author = {Kundan Krishna and Prakhar Gupta and Sanjana Ramprasad and Byron C. Wallace and Jeffrey P. Bigham and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:2305.14296},
  year   = {2023}
}

备注

EMNLP Findings 2023 Camera Ready