HunSum-1:一个面向匈牙利语的抽取式摘要数据集
计算与语言
2023-02-02 v1
摘要
我们介绍了HunSum-1:一个用于匈牙利语抽取式摘要的数据集,包含114万篇新闻文章。该数据集通过CommonCrawl从9个主要匈牙利新闻网站收集、清洗并去重构建而成。利用该数据集,我们基于huBERT和mT5构建了抽取式摘要模型。我们通过对模型结果进行定量和定性分析,展示了所创建数据集的价值。HunSum-1数据集、我们实验中使用的所有模型以及我们的代码均开源可用。
引用
@article{arxiv.2302.00455,
title = {HunSum-1: an Abstractive Summarization Dataset for Hungarian},
author = {Botond Barta and Dorina Lakatos and Attila Nagy and Milán Konor Nyist and Judit Ács},
journal= {arXiv preprint arXiv:2302.00455},
year = {2023}
}