一种用于标题检测的监督学习方法
信息检索
2018-09-06 v1 计算与语言
机器学习
机器学习
摘要
随着便携式文档格式(PDF)文件格式的日益普及,分析其结构以进行文本提取和分析的研究十分必要。检测标题可以是分类和提取有意义数据的关键组成部分。本研究训练一个监督学习模型来检测标题,其特征通过递归特征消除仔细筛选。性能最佳的 classifier 准确率为 96.95%,灵敏度为 0.986,特异度为 0.953。这项关于标题检测的研究有助于基于 PDF 的文本提取领域,并可应用于多种专业和政策背景下的大规模 PDF 文本分析自动化。
引用
@article{arxiv.1809.01477,
title = {A Supervised Learning Approach For Heading Detection},
author = {Sahib Singh Budhiraja and Vijay Mago},
journal= {arXiv preprint arXiv:1809.01477},
year = {2018}
}