中文

处理文档结构:法语历史报纸的逻辑版面分析

计算与语言 2023-06-22 v2

摘要

背景。近年来,图书馆与档案馆开展了重要的数字化行动,开放了海量历史文献馆藏。虽然此类文献常以 XML ALTO 文档形式提供,但缺乏关于其逻辑结构的信息。本文探讨应用于法语历史文献的逻辑版面分析(Logical Layout Analysis)问题。我们提出一种基于规则的方法,并与两种机器学习模型 RIPPER 和 Gradient Boosting 进行评估和比较。我们的数据集包含 20 世纪上半叶在 Franche-Comté 地区出版的法语报纸、期刊和杂志。结果。我们的基于规则的系统在几乎所有评估中均优于另外两种模型。其召回率结果尤其更好,表明我们的系统比另外两种模型覆盖了更多类型的每种逻辑标签。比较 RIPPER 与 Gradient Boosting 可观察到,Gradient Boosting 具有更好的精确率,而 RIPPER 具有更好的召回率。结论。评估表明我们的系统优于两种机器学习模型,并提供显著更高的召回率。这也证实我们的系统可用于生成规模足够大的标注数据集,从而可考虑采用机器学习或深度学习方法来完成逻辑版面分析任务。将规则与机器学习模型结合为混合系统有可能提供更好的性能。此外,由于历史文献的版面变化迅速,克服此问题的一个可能方案是应用规则学习算法来引导适应不同出版时期的规则集。

关键词

引用

@article{arxiv.2202.08125,
  title  = {Processing the structure of documents: Logical Layout Analysis of historical newspapers in French},
  author = {Nicolas Gutehrlé and Iana Atanassova},
  journal= {arXiv preprint arXiv:2202.08125},
  year   = {2023}
}

备注

25 pages, 5 figures, 16 tables. This paper is to be submited to the NLP4DH edition of the Journal of Data Mining and Digital Humanities