中文

大型语言模型用于捷克语文档摘要:从历史到当下

计算与语言 2025-11-25 v1

摘要

文本摘要是将较长文本自动压缩成更短、连贯的摘要,同时保留原始含义和关键信息的任务。尽管该任务在英语及其他高资源语言中受到广泛研究,但捷克语摘要,尤其是在历史文档语境下,仍属探索不足的领域。这主要源于捷克语的语言复杂性以及缺乏高质量标注数据集的因素。本文通过利用大型语言模型(LLM)的能力,特别是Mistral和mT5,这些模型在广泛的自然语言处理任务和多语言环境中表现出色来弥补这一差距。此外,我们还提出了一种翻译方法,即首先将捷克语文本翻译成英语,使用英语模型进行摘要处理,然后将摘要翻译回捷克语。本研究的主要贡献如下:我们展示了LLMs在SumeCzech数据集上实现了新的状态突破(SOTA),该数据集是现代捷克语文本摘要的基准,显示出多语言LLMs即使在形态学复杂、中等资源语言(如捷克语)上也能发挥良好效果。我们引入了新数据集Posel od Čerchova,旨在为捷克语历史文本摘要提供数据支持。该数据集源于数字化的19世纪出版物,经过标注用于抽象摘要。我们提供了使用现代LLMs的初始基线,以便进一步研究这一较少被关注的领域。通过结合前沿模型与现代与历史捷克语数据集,本工作为捷克语摘要的进一步发展奠定了基础,为未来在捷克语历史文档处理和低资源摘要等领域的研究提供了宝贵资源。

关键词

引用

@article{arxiv.2511.18848,
  title  = {Large Language Models for the Summarization of Czech Documents: From History to the Present},
  author = {Václav Tran and Jakub Šmíd and Ladislav Lenc and Jean-Pierre Salmon and Pavel Král},
  journal= {arXiv preprint arXiv:2511.18848},
  year   = {2025}
}