中文

一种用于标题检测的监督学习方法

信息检索 2018-09-06 v1 计算与语言 机器学习 机器学习

摘要

随着便携式文档格式(PDF)文件格式的日益普及,分析其结构以进行文本提取和分析的研究十分必要。检测标题可以是分类和提取有意义数据的关键组成部分。本研究训练一个监督学习模型来检测标题,其特征通过递归特征消除仔细筛选。性能最佳的 classifier 准确率为 96.95%,灵敏度为 0.986,特异度为 0.953。这项关于标题检测的研究有助于基于 PDF 的文本提取领域,并可应用于多种专业和政策背景下的大规模 PDF 文本分析自动化。

关键词

引用

@article{arxiv.1809.01477,
  title  = {A Supervised Learning Approach For Heading Detection},
  author = {Sahib Singh Budhiraja and Vijay Mago},
  journal= {arXiv preprint arXiv:1809.01477},
  year   = {2018}
}