中文

TSTR:太短难表意,细粒度摘要来!引言引导的扩展摘要生成

计算与语言 2022-06-03 v1

摘要

许多科学论文(如 arXiv 与 PubMed 数据集中者)的摘要长度在 50-1000 词间不等,平均约 200 词,其中较长摘要通常传达更多关于源论文的信息。直至近来,科学摘要研究通常聚焦于遵循现有科学摘要数据集生成简短类摘要的摘要。在源文本相对长篇的领域(如科学文献),此类摘要无法超越笼统粗略的概览并提供源文档中的显著信息。近期解决该问题的兴趣促使了含 400-600 词人工撰写摘要的科学数据集 arXiv-Long 与 PubMed-Long 的构建,从而为长/扩展摘要生成研究提供了平台。扩展摘要在提供超越粗略信息的细节同时便于更快阅读。本文提出 TSTR,一种利用文档引言信息作为指向其显著信息指针的抽取式摘要器。在两个现有大规模扩展摘要数据集上的评估表明,相较于强基线与时下最优方法,其 Rouge 与平均 Rouge(F1)分数(除一种情况外)均有统计显著改进。全面人工评估在连贯性与完整性上偏好我们生成的扩展摘要。

关键词

引用

@article{arxiv.2206.00847,
  title  = {TSTR: Too Short to Represent, Summarize with Details! Intro-Guided Extended Summary Generation},
  author = {Sajad Sotudeh and Nazli Goharian},
  journal= {arXiv preprint arXiv:2206.00847},
  year   = {2022}
}

备注

9 pages, NAACL 2022 Long Paper