中文

LexRank:基于图的词汇中心性作为文本摘要中的显著性

计算与语言 2011-09-28 v2

摘要

我们引入一种随机基于图的方法,用于计算自然语言处理中文本单元的相对重要性。我们在文本摘要(TS)问题上测试了该技术。抽取式 TS 依赖于句子显著性的概念,以识别文档或文档集中最重要的句子。显著性通常根据特定重要词汇的出现或与中心伪句子的相似性来定义。我们考虑一种新方法 LexRank,基于句子图表示中的特征向量中心性来计算句子重要性。在该模型中,基于句内余弦相似度的连通矩阵被用作句子图表示的邻接矩阵。我们基于 LexRank 的系统在最近的 DUC 2004 评估中的不止一个任务中排名第一。在本文中,我们对我们的方法进行了详细分析,并将其应用于包括早期 DUC 评估数据在内的更大数据集。我们讨论了使用相似度图计算中心性的几种方法。结果表明,在大多数情况下,基于度的方法(包括 LexRank)优于基于中心的方法以及参与 DUC 的其他系统。此外,带阈值的 LexRank 优于包括连续 LexRank 在内的其他基于度的技术。我们还表明,我们的方法对由文档不完善主题聚类导致的数据噪声相当不敏感。

关键词

引用

@article{arxiv.1109.2128,
  title  = {LexRank: Graph-based Lexical Centrality as Salience in Text Summarization},
  author = {Gunes Erkan and Dragomir R. Radev},
  journal= {arXiv preprint arXiv:1109.2128},
  year   = {2011}
}