TalkSumm:基于会议报告的科技论文摘要数据集与可扩展标注方法
计算与语言
2019-06-14 v2
摘要
目前,科技论文摘要任务尚无大规模训练数据可用。在本文中,我们提出一种新方法,通过利用科学会议上报告视频自动生成科技论文摘要。我们假设此类报告构成了对论文内容连贯而简洁的描述,并可构成良好摘要的基础。我们收集了 1716 篇论文及其对应视频,并创建了一个论文摘要数据集。在该数据集上训练的模型取得了与在人工创建摘要数据集上训练的模型相似的性能。此外,我们通过人类专家验证了我们的摘要质量。
引用
@article{arxiv.1906.01351,
title = {TalkSumm: A Dataset and Scalable Annotation Method for Scientific Paper Summarization Based on Conference Talks},
author = {Guy Lev and Michal Shmueli-Scheuer and Jonathan Herzig and Achiya Jerbi and David Konopnicki},
journal= {arXiv preprint arXiv:1906.01351},
year = {2019}
}
备注
Accepted to ACL 2019