中文

Vārta:一个面向印度语言的大规模标题生成数据集

计算与语言 2023-05-11 v1

摘要

我们提出Vārta,一个面向印度语言标题生成的大规模多语言数据集。该数据集包含14种不同印度语言(及英语)的4180万篇新闻文章,来源为多种高质量渠道。据我们所知,这是当前可用的印度语言精选文章的最大集合。我们利用所收集的数据通过一系列实验来回答与印度NLP及一般多语言研究相关的重要问题。我们表明,即便对最先进的抽取式模型而言该数据集也具有挑战性,且其表现仅略优于抽取式基线。得益于其规模,我们还展示该数据集可用于预训练强大的语言模型,在NLU与NLG基准上均优于有竞争力的基线。

关键词

引用

@article{arxiv.2305.05858,
  title  = {V\=arta: A Large-Scale Headline-Generation Dataset for Indic Languages},
  author = {Rahul Aralikatte and Ziling Cheng and Sumanth Doddapaneni and Jackie Chi Kit Cheung},
  journal= {arXiv preprint arXiv:2305.05858},
  year   = {2023}
}

备注

Findings of ACL 2023