中文

L3Cube-MahaSum:面向印地语抽象文本摘要的全面数据集和 BART 模型

计算与语言 2024-10-15 v1 机器学习

摘要

我们提出了 MahaSUM 数据集,这是一个包含大量印地语新闻文章的大规模集合,旨在促进印地语语言中抽象摘要任务模型的训练和评估。该数据集包含 25k 个样本,通过从广泛的在线新闻来源抓取文章并手动验证摘要来创建。此外,我们训练了一个IndicBART模型,这是针对印地语言优化的 BART 模型变体,使用 MahaSUM 数据集进行训练。我们评估了在抽象摘要任务上的训练模型性能,并展示了其在印地语中生成高质量摘要的有效性。我们的工作推动了印地语言自然语言处理研究的发展,并为该领域未来研究提供了宝贵资源。该数据集和模型已公开分享至 https://github.com/l3cube-pune/MarathiNLP

关键词

引用

@article{arxiv.2410.09184,
  title  = {L3Cube-MahaSum: A Comprehensive Dataset and BART Models for Abstractive Text Summarization in Marathi},
  author = {Pranita Deshmukh and Nikita Kulkarni and Sanhita Kulkarni and Kareena Manghani and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2410.09184},
  year   = {2024}
}