中文

处理树状结构文本:目录页解析

计算与语言 2021-11-25 v1

摘要

确定文本的阅读顺序是文档理解的基础。在文本按行序列组织且垂直对齐贯穿页面高度(形成可从左至右阅读的多栏)的页面中,这个问题很容易解决。我们提出一种情况——目录页解析问题——其中信息以不规则、视觉化组织的二维格式呈现在页面上。目录页在金融招股说明书中相当常见,承载着关于组织、其地址和关系的信息,这些信息对客户入职中的业务任务至关重要。有趣的是,目录页有时具有层次结构,这促使我们需要将阅读序列推广为阅读树。我们提出了识别目录页并构建阅读树的解决方案,使用针对文本段的(学习到的)分类器以及自底向上(从右到左、从下到上)的段遍历。该解决方案是支持从客户入职文档中自动提取组织、地址和关系信息的生产服务的关键组成部分。

关键词

引用

@article{arxiv.2111.12317,
  title  = {Handling tree-structured text: parsing directory pages},
  author = {Sarang Shrivastava and Afreen Shaikh and Shivani Shrivastava and Chung Ming Ho and Pradeep Reddy and Vijay Saraswat},
  journal= {arXiv preprint arXiv:2111.12317},
  year   = {2021}
}