中文

用于文本摘要的印度语言数据集综述

计算与语言 2022-04-28 v3

摘要

在本文中,我们调研了印度语言(ILs)中用于文本摘要(TS)的数据集,这些语言也属于低资源语言(LRLs)。我们试图回答一个主要问题:印度语言文本摘要(ILTS)数据集的库是在增长还是存在资源匮乏?为回答该主要问题,我们提出两个关于ILTS数据集的子问题:第一,ILTS数据集具有何种特征:格式与领域?第二,ILTS数据集的这些特征与高资源语言(HRLs)特别是英语有何不同?我们聚焦于2012–2022年间已发表的ILTS研究工作中报告的数据集。对ILTS与英语数据集的调研揭示了两个相似点与一个差异。两个相似点是:第一,数据集领域通常为新闻(Hermann et al., 2015);第二相似点是数据集格式兼具抽取式与生成式。差异在于数据集开发研究的进展方式。与英语相比,ILs在数据集开发和公开发布方面进展缓慢。我们认为ILTS数据集数量相对较少的原因有二:第一,缺乏开发TS工具与资源的专门论坛;第二,公共领域缺乏可共享的标准数据集。

关键词

引用

@article{arxiv.2203.16127,
  title  = {An Overview of Indian Language Datasets used for Text Summarization},
  author = {Shagun Sinha and Girish Nath Jha},
  journal= {arXiv preprint arXiv:2203.16127},
  year   = {2022}
}