中文

从新闻到摘要:构建用于抽取式与生成式摘要的匈牙利语语料库

计算与语言 2024-04-15 v2

摘要

训练摘要模型需要大量训练数据。然而,对于匈牙利语等资源匮乏的语言,公开可用的模型与数据集极为稀缺。为填补这一空白,本文介绍了 HunSum-2,一个开源的匈牙利语语料库,适用于训练生成式与抽取式摘要模型。该数据集由 Common Crawl 语料库的片段组装而成,并经过了彻底的清洗、预处理与去重。除生成式摘要外,我们还利用句子相似度为抽取式摘要生成句子级标签。我们使用收集到的数据集训练了抽取式与生成式摘要的基线模型。为展示所训练模型的有效性,我们进行了定量与定性评估。我们的数据集、模型与代码均公开可用,以鼓励在各个领域进行复现、进一步研究及实际应用。

关键词

引用

@article{arxiv.2404.03555,
  title  = {From News to Summaries: Building a Hungarian Corpus for Extractive and Abstractive Summarization},
  author = {Botond Barta and Dorina Lakatos and Attila Nagy and Milán Konor Nyist and Judit Ács},
  journal= {arXiv preprint arXiv:2404.03555},
  year   = {2024}
}