中文

一种面向科学论文抽取式摘要的监督方法

计算与语言 2017-06-14 v1 人工智能 神经与进化计算 应用统计 机器学习

摘要

自动摘要是一种将文档浓缩为其主要论点的常用方法。该领域近期的研究侧重于神经摘要方法,这类方法对数据量的需求极大。然而,目前仅有少数大型数据集,且针对传统上备受关注的科学出版物领域尚无此类数据集,这为围绕大型复杂文档的编码开辟了充满挑战的研究途径。在本文中,我们利用大量作者提供的摘要资源,引入了一个用于计算机科学出版物摘要的新数据集,并展示了进一步扩展该数据集的直接方法。我们在该数据集上开发了模型,同时利用了神经句子编码与传统摘要特征,并表明对句子及其局部和全局上下文进行编码的模型表现最佳,显著优于成熟的基线方法。

关键词

引用

@article{arxiv.1706.03946,
  title  = {A Supervised Approach to Extractive Summarisation of Scientific Papers},
  author = {Ed Collins and Isabelle Augenstein and Sebastian Riedel},
  journal= {arXiv preprint arXiv:1706.03946},
  year   = {2017}
}

备注

11 pages, 6 figures