中文

利用数字化报纸收集低资源语言的摘要数据

计算与语言 2025-11-19 v1

摘要

高质量的摘要数据在缺乏代表性语言中仍然稀缺。然而,近期通过数字化努力获得的历史报纸提供了大量未充分利用的、天然标注数据的来源。本文提出了一种新方法,通过“前页摘要”收集自然发生的摘要,其中编辑器会总结完整的文章。我们展示了这一现象在七种多样化语言中都很常见,并且支持多文档摘要。为了扩大数据收集规模,我们开发了一种适用于不同语言资源水平的自动化过程。最终,我们将该过程应用于以希伯来语报纸为例,产生了 HEBTEASESUM——首个专注于希伯来语的多文档摘要数据集。

关键词

引用

@article{arxiv.2511.14598,
  title  = {Leveraging Digitized Newspapers to Collect Summarization Data in Low-Resource Languages},
  author = {Noam Dahan and Omer Kidron and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2511.14598},
  year   = {2025}
}