中文

使用预训练语言模型的低资源摘要

计算与语言 2023-10-05 v1

摘要

随着基于深度学习的神经网络模型的出现,自然语言处理(NLP)在文本数据处理方面的效率和准确性都有了显著改进。然而,研究大多局限于英语等高资源语言,低资源语言在训练数据集以及甚至具有基线评估结果的模型方面仍然缺乏可用资源。考虑到低资源语言资源的有限可用性,我们提出了一种将基于自注意力Transformer的架构模型(mBERT、mT5)适配于低资源摘要的方法,并补充构建了低资源语言乌尔都语的一个新基线数据集(76.5k 文章-摘要对)。选择新闻(公开可用来源)作为应用领域,有潜力使所提方法可用于其他资源有限语言的复现。我们适配的摘要模型 \textit{urT5} 相比 \textit{mT5} 规模减小高达 44.78%,能够有效捕获低资源语言的上下文信息,其评估分数(高达 46.35 ROUGE-1、77 BERTScore)与高资源语言英语中的 SOTA 模型 \textit{(PEGASUS: 47.21, BART: 45.14 on XSUM Dataset)} 相当。所提方法在有限资源设置下为抽取式以及生成式摘要提供了一种具有竞争力的评估结果的基线方法。

关键词

引用

@article{arxiv.2310.02790,
  title  = {Low Resource Summarization using Pre-trained Language Models},
  author = {Mubashir Munaf and Hammad Afzal and Naima Iltaf and Khawir Mahmood},
  journal= {arXiv preprint arXiv:2310.02790},
  year   = {2023}
}

备注

17 pages, 7 figures, 3 tables