中文

分割杂乱文本:检测源自历史报纸图像的文本边界

计算机视觉与模式识别 2023-12-21 v1 计算与语言 机器学习

摘要

文本分割是将文档划分为章节的任务,通常是执行额外自然语言处理任务的前提。现有的文本分割方法通常是在包含不同主题的清晰叙事风格文本上开发和测试的。在此,我们考虑一个具有挑战性的文本分割任务:将报纸结婚公告列表划分为每条公告为一个单元。在许多情况下,信息并未构造成句子,且相邻片段在主题上并无明显区别。此外,源自历史报纸图像并通过光学字符识别(OCR)获得的公告文本包含许多排版错误。因此,这些公告不适用于现有技术的分割。我们提出了一种基于深度学习的新模型来分割此类文本,并表明其在该任务上显著优于现有的最先进方法。

关键词

引用

@article{arxiv.2312.12773,
  title  = {Segmenting Messy Text: Detecting Boundaries in Text Derived from Historical Newspaper Images},
  author = {Carol Anderson and Phil Crone},
  journal= {arXiv preprint arXiv:2312.12773},
  year   = {2023}
}

备注

8 pages, 4 figures