中文

基于多语言变换模型的低资源尼泊尔语言抽象摘要

计算与语言 2024-10-01 v1 人工智能

摘要

尼泊尔语言的自动文本摘要是自然语言处理(NLP)领域尚未探索的方向。尽管提取式摘要研究已较为充实,但针对低资源语言如尼泊尔语的抽象式摘要研究仍相对缺乏。本研究探索了使用多语言变换模型,具体包括mBART和mT5,为尼泊尔新闻文章生成标题进行抽象式摘要。该研究通过网页抓取从多个尼泊尔新闻门户网站收集的新闻数据,构建了摘要数据集。随后采用不同策略对这些多语言模型进行微调,并通过ROUGE分数和人类评估评估微调后模型的性能,确保生成的摘要具有连贯性并传达原意。在人类评估中,参与者被要求根据相关性、流畅性、简洁性、信息量、事实准确性和覆盖范围等标准,从模型生成的摘要中选择最佳方案。在ROUGE评估中,4位量化的mBART模型通过LoRA在生成尼泊尔新闻标题方面表现优于其他模型,在人类评估中占34.05%的选中率,均 outperform于其他为尼泊尔新闻标题生成而微调的模型。

关键词

引用

@article{arxiv.2409.19566,
  title  = {Abstractive Summarization of Low resourced Nepali language using Multilingual Transformers},
  author = {Prakash Dhakal and Daya Sagar Baral},
  journal= {arXiv preprint arXiv:2409.19566},
  year   = {2024}
}