中文

孟加拉语抽取式新闻摘要(BANS):一种神经注意力方法

计算与语言 2020-12-18 v1 人工智能

摘要

抽象式摘要是基于从原始文本文档中提取的信息生成新颖句子的过程,同时保留上下文。由于抽象式摘要的固有复杂性,过去大多数研究工作集中于抽取式摘要方法。然而,随着序列到序列(seq2seq)模型的成功,抽象式摘要变得更为可行。尽管基于英语的抽象式摘要已有大量显著研究,但关于孟加拉语抽象式新闻摘要(BANS)的工作仅有少数。在本文中,我们提出了一种基于seq2seq的长短期记忆(LSTM)网络模型,在编码器-解码器处采用注意力机制。我们所提系统部署了一种基于局部注意力的模型,可生成长词序列及清晰、类人的句子,并包含原文档的重要信息。我们还准备了一个包含超过19k篇文章及对应人工撰写摘要的数据集,采集自bangla.bdnews24.com1,迄今为止是孟加拉语新闻文档摘要最大且公开发布于Kaggle2的数据集。我们从定性和定量上评估了我们的模型,并与其他已发表结果进行比较。其在人类评估分数上相较BANS的最先进方法表现出显著改进。

关键词

引用

@article{arxiv.2012.01747,
  title  = {Bengali Abstractive News Summarization(BANS): A Neural Attention Approach},
  author = {Prithwiraj Bhattacharjee and Avi Mallick and Md Saiful Islam and Marium-E-Jannat},
  journal= {arXiv preprint arXiv:2012.01747},
  year   = {2020}
}

备注

10 Pages, 2 figures, 4 tables, 2nd International Conference on Trends in Computational and Cognitive Engineering(TCCE-2020)