中文

Mukhyansh:面向印度语言的标题生成数据集

计算与语言 2023-11-30 v1 人工智能

摘要

自然语言处理(NLP)领域中的标题生成任务具有重要意义,其致力于将文本内容的真实精髓提炼为简洁且引人注目的摘要。尽管在英语等广泛使用的语言的标题生成方面已取得显著进展,但在生成如丰富多样的印度语言等低资源语言的标题时仍存在诸多挑战。具体而言,阻碍印度语言标题生成的一个突出障碍是高质量标注数据的匮乏。为填补这一关键空白,我们荣幸地推出Mukhyansh,一个专为印度语言标题生成量身定制的大规模多语言数据集。Mukhyansh包含超过339万篇文章-标题对,涵盖泰卢固语、泰米尔语、卡纳达语、马拉雅拉姆语、印地语、孟加拉语、马拉地语和古吉拉特语八种主要印度语言。我们对若干最先进的基线模型进行了全面评估。此外,通过对现有工作的实证分析,我们表明Mukhyansh优于所有其他模型,在全部8种语言上取得了31.43的惊人平均ROUGE-L分数。

关键词

引用

@article{arxiv.2311.17743,
  title  = {Mukhyansh: A Headline Generation Dataset for Indic Languages},
  author = {Lokesh Madasu and Gopichand Kanumolu and Nirmal Surange and Manish Shrivastava},
  journal= {arXiv preprint arXiv:2311.17743},
  year   = {2023}
}

备注

Accepted at PACLIC 2023