中文

在历史登记册行为单元分割的图像模型中引入关键词位置

计算机视觉与模式识别 2021-11-03 v1

摘要

随着深度学习的兴起,近年来将复杂图像分割为语义区域的研究兴趣日益增长。直到最近,大多数历史文档分析现有方法聚焦于文档的视觉外观,忽略了文本内容可提供的丰富信息。然而,仅依赖视觉特征有时无法将复杂文档分割为语义区域,近期模型同时嵌入视觉与文本信息。本文中,我们关注利用视觉与文本信息将历史登记册分割为结构化且有意义的单元(如行为记录)。行为记录是包含有价值知识(如人口统计信息:洗礼、婚姻或死亡)或王室决定(捐赠或赦免)的文本记录。我们提出一种简单流程,用含关键短语的文本行位置丰富文档图像,并表明在此类图像上运行标准基于图像的版式分析系统可带来显著提升。实验表明,在文本行位置与内容由自动识别系统提取的真实使用条件下,行为记录的检测 mAP 从 38% 提升至 74%。

关键词

引用

@article{arxiv.2109.08477,
  title  = {Including Keyword Position in Image-based Models for Act Segmentation of Historical Registers},
  author = {Mélodie Boillet and Martin Maarand and Thierry Paquet and Christopher Kermorvant},
  journal= {arXiv preprint arXiv:2109.08477},
  year   = {2021}
}