中文

RoLargeSum:面向摘要、标题与关键词生成的大规模方言感知罗马尼亚语新闻数据集

计算与语言 2024-12-17 v1

摘要

使用有监督自动摘要方法需要包含文档及其摘要对的充足语料库。与自然语言处理中的许多任务类似,大多数可用于摘要的数据集都是英文的,这给开发其他语言的摘要模型带来了挑战。因此,在本工作中,我们引入了 RoLargeSum,这是一个大规模罗马尼亚语摘要数据集,从罗马尼亚和摩尔多瓦共和国的各种公开新闻网站抓取,并进行了彻底清洗以确保高质量标准。RoLargeSum 包含超过 615K 篇新闻文章,及其摘要、标题、关键词、方言和我们在目标网站上找到的其他元数据。我们进一步在 RoLargeSum 上评估了若干 BART 变体和开源大语言模型的性能以进行基准测试。我们手动评估了表现最佳系统的结果,以深入了解该数据集的潜在缺陷及未来发展方向。

关键词

引用

@article{arxiv.2412.11317,
  title  = {RoLargeSum: A Large Dialect-Aware Romanian News Dataset for Summary, Headline, and Keyword Generation},
  author = {Andrei-Marius Avram and Mircea Timpuriu and Andreea Iuga and Vlad-Cristian Matei and Iulian-Marius Tăiatu and Tudor Găină and Dumitru-Clementin Cercel and Florin Pop and Mihaela-Claudia Cercel},
  journal= {arXiv preprint arXiv:2412.11317},
  year   = {2024}
}

备注

Accepted at COLING 2024 (long papers)