利用数字化报纸收集低资源语言的摘要数据
计算与语言
2025-11-19 v1
摘要
高质量的摘要数据在缺乏代表性语言中仍然稀缺。然而,近期通过数字化努力获得的历史报纸提供了大量未充分利用的、天然标注数据的来源。本文提出了一种新方法,通过“前页摘要”收集自然发生的摘要,其中编辑器会总结完整的文章。我们展示了这一现象在七种多样化语言中都很常见,并且支持多文档摘要。为了扩大数据收集规模,我们开发了一种适用于不同语言资源水平的自动化过程。最终,我们将该过程应用于以希伯来语报纸为例,产生了 HEBTEASESUM——首个专注于希伯来语的多文档摘要数据集。
引用
@article{arxiv.2511.14598,
title = {Leveraging Digitized Newspapers to Collect Summarization Data in Low-Resource Languages},
author = {Noam Dahan and Omer Kidron and Gabriel Stanovsky},
journal= {arXiv preprint arXiv:2511.14598},
year = {2025}
}