中文

GAE-ISumm:基于无监督图的印度语言摘要方法

计算与语言 2022-12-27 v1 机器学习

摘要

文档摘要旨在生成文本文档的精确且连贯的摘要。许多深度学习摘要模型主要为英语开发,常需要大规模训练语料与高效的预训练语言模型及工具。然而,面向低资源印度语言的英语摘要模型常受丰富的形态变化、句法与语义差异所限。本文提出 GAE-ISumm,一种从无标注文本文档抽取摘要的无监督印度语摘要模型。具体而言,我们提出的 GAE-ISumm 模型使用图自编码器(GAE)联合学习文本表示与文档摘要。我们还提供手动标注的泰卢固语摘要数据集 TELSUM,以用我们的 GAE-ISumm 模型进行实验。此外,我们使用最公开的印度语言摘要数据集实验,以探究 GAE-ISumm 在其他印度语言上的有效性。我们在七种语言上对 GAE-ISumm 的实验得出如下观察:(i) 其在所有数据集上具竞争力或优于 SOTA 结果,(ii) 其在 TELSUM 上报告了基准结果,(iii) 在所提模型中引入位置与簇信息提升了摘要性能。

关键词

引用

@article{arxiv.2212.12937,
  title  = {GAE-ISumm: Unsupervised Graph-Based Summarization of Indian Languages},
  author = {Lakshmi Sireesha Vakada and Anudeep Ch and Mounika Marreddy and Subba Reddy Oota and Radhika Mamidi},
  journal= {arXiv preprint arXiv:2212.12937},
  year   = {2022}
}

备注

9 pages, 7 figures