基于注意力机制与伪标记数据的科技论文句子抽取
信息检索
2018-02-14 v1 人工智能
计算与语言
摘要
本文提出一种弱监督句子抽取技术,用于识别科技论文中值得纳入摘要的重要句子。我们提出一种新的基于注意力的深度学习架构,联合学习识别重要内容以及指示值得摘取句子的线索短语。我们提出一种新的上下文嵌入技术,利用主题模型确定给定论文的焦点,并将其与基于 LSTM 的序列编码器联合使用,以学习句子单词上的注意力权重。我们使用通过 ACL anthology 公开可用的一批文章进行实验。在多项 ROUGE 指标上,我们的系统性能优于多种 SOTA 抽取技术。它还生成更连贯的摘要并保留文档的整体结构。
引用
@article{arxiv.1802.04675,
title = {Attention based Sentence Extraction from Scientific Articles using Pseudo-Labeled data},
author = {Parth Mehta and Gaurav Arora and Prasenjit Majumder},
journal= {arXiv preprint arXiv:1802.04675},
year = {2018}
}