TLDR9+:用于社交媒体帖子极端摘要的大规模资源
计算与语言
2021-10-06 v2
摘要
近期开发的摘要系统模型包含数百万参数,其性能高度依赖于训练数据的丰富程度。尽管现有大多数摘要语料库的数据量在数千到一百万之间,但生成规模达数百万量级的大规模摘要数据集仍有待探索。实际上,更多数据能更好地将训练模式泛化到未见过的数据上。本文引入 TLDR9+——一个大规模摘要数据集——包含从 Reddit 讨论论坛提取的超过 900 万条训练实例(https://github.com/sajastu/reddit_collector)。该数据集专为极端摘要(即生成高压缩度与高抽象度的一句话摘要)而收集,规模比先前提出的数据集大两倍以上。我们更进一步,借助人工标注,从 TLDR9+ 中采样高质量实例提炼出一个更细粒度的数据集,称之为 TLDRHQ 数据集。我们进一步在提出的数据集上测试了多种最先进的摘要模型。
引用
@article{arxiv.2110.01159,
title = {TLDR9+: A Large Scale Resource for Extreme Summarization of Social Media Posts},
author = {Sajad Sotudeh and Hanieh Deilamsalehy and Franck Dernoncourt and Nazli Goharian},
journal= {arXiv preprint arXiv:2110.01159},
year = {2021}
}
备注
Accepted to New Frontiers in Summarization Workshop (EMNLP 2021)