文本数据一致性评分及其在R中的实现
计算与语言
2021-01-14 v1
摘要
本文引入一种使用n-gram模型从PDF提取文本的可复现清洗流程。我们的方法将最初提取的文本与这些模型以先前文本为刺激所生成或预期的文本进行比较。为引导该流程,我们引入一致性评分的概念,即模型所预期文本的比例。这用于监测清洗过程中及不同语料库之间的变化。我们在《简·爱》一书文本上演示该流程,并引入一个Shiny应用和R包以便他人更易采用我们的流程。
引用
@article{arxiv.2101.05225,
title = {On consistency scores in text data with an implementation in R},
author = {Ke-Li Chiu and Rohan Alexander},
journal= {arXiv preprint arXiv:2101.05225},
year = {2021}
}
备注
13 pages, 0 figures