Vārta:一个面向印度语言的大规模标题生成数据集
计算与语言
2023-05-11 v1
摘要
我们提出Vārta,一个面向印度语言标题生成的大规模多语言数据集。该数据集包含14种不同印度语言(及英语)的4180万篇新闻文章,来源为多种高质量渠道。据我们所知,这是当前可用的印度语言精选文章的最大集合。我们利用所收集的数据通过一系列实验来回答与印度NLP及一般多语言研究相关的重要问题。我们表明,即便对最先进的抽取式模型而言该数据集也具有挑战性,且其表现仅略优于抽取式基线。得益于其规模,我们还展示该数据集可用于预训练强大的语言模型,在NLU与NLG基准上均优于有竞争力的基线。
引用
@article{arxiv.2305.05858,
title = {V\=arta: A Large-Scale Headline-Generation Dataset for Indic Languages},
author = {Rahul Aralikatte and Ziling Cheng and Sumanth Doddapaneni and Jackie Chi Kit Cheung},
journal= {arXiv preprint arXiv:2305.05858},
year = {2023}
}
备注
Findings of ACL 2023