基于多语言变换模型的低资源尼泊尔语言抽象摘要
计算与语言
2024-10-01 v1 人工智能
摘要
尼泊尔语言的自动文本摘要是自然语言处理(NLP)领域尚未探索的方向。尽管提取式摘要研究已较为充实,但针对低资源语言如尼泊尔语的抽象式摘要研究仍相对缺乏。本研究探索了使用多语言变换模型,具体包括mBART和mT5,为尼泊尔新闻文章生成标题进行抽象式摘要。该研究通过网页抓取从多个尼泊尔新闻门户网站收集的新闻数据,构建了摘要数据集。随后采用不同策略对这些多语言模型进行微调,并通过ROUGE分数和人类评估评估微调后模型的性能,确保生成的摘要具有连贯性并传达原意。在人类评估中,参与者被要求根据相关性、流畅性、简洁性、信息量、事实准确性和覆盖范围等标准,从模型生成的摘要中选择最佳方案。在ROUGE评估中,4位量化的mBART模型通过LoRA在生成尼泊尔新闻标题方面表现优于其他模型,在人类评估中占34.05%的选中率,均 outperform于其他为尼泊尔新闻标题生成而微调的模型。
引用
@article{arxiv.2409.19566,
title = {Abstractive Summarization of Low resourced Nepali language using Multilingual Transformers},
author = {Prakash Dhakal and Daya Sagar Baral},
journal= {arXiv preprint arXiv:2409.19566},
year = {2024}
}