中文

基于图卷积自编码器的二部图预训练用于无监督抽取式摘要

计算与语言 2023-10-31 v1 人工智能

摘要

预训练句子表示在无监督文档抽取式摘要中对于识别重要句子至关重要。然而,传统的“预训练—句子排序”两步范式由于优化目标不同而产生鸿沟。为解决此问题,我们认为利用专门设计用于优化凝聚性与区分性句子表示的流程所得到的预训练嵌入,有助于对重要句子进行排序。为此,我们提出一种新颖的图预训练自编码器,通过句子-词二部图显式建模句内区分性特征与句间凝聚性特征来获取句子嵌入。这些预训练句子表示随后被用于基于图的排序算法中以进行无监督摘要。我们的方法通过提供值得摘要的句子表示,在无监督摘要框架中取得了主导性性能,并在下游任务中超越了基于重型 BERT 或 RoBERTa 的句子表示。

关键词

引用

@article{arxiv.2310.18992,
  title  = {Bipartite Graph Pre-training for Unsupervised Extractive Summarization with Graph Convolutional Auto-Encoders},
  author = {Qianren Mao and Shaobo Zhao and Jiarui Li and Xiaolei Gu and Shizhu He and Bo Li and Jianxin Li},
  journal= {arXiv preprint arXiv:2310.18992},
  year   = {2023}
}

备注

Accepted by the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)