中文

大数据集的对应因子分析:一项3000万词的案例研究;以及使用Apache Solr与R语言对应分析的对比分析

计算与语言 2015-07-07 v1

摘要

我们考虑了大量文本数据集,这些数据集为烹饪食谱。我们研究了数据的词项分布及其他分布特性。我们的目标是考察各种分析方法,这些方法允许在高细节和低细节尺度上进行信息挖掘。度量空间嵌入对于我们探究此数据的语义属性至关重要。我们考虑将所有数据投影到数据聚合版本的分析中,并将其与将数据聚合版本投影到所有数据的分析中进行对比。类似地,对于词项集,我们考察了选定词项的分析。我们还研究了固有的词项关联,例如单复数之间的关联。除了在R语言中使用对应分析进行潜在语义空间映射外,我们还使用了Apache Solr。文中描述了Solr服务器的设置及查询执行过程。另一个新颖之处在于,Solr中支持基于所有数据的主因子平面映射进行查询,这使用了基于因子投影的边界框查询。

关键词

引用

@article{arxiv.1507.01529,
  title  = {Correspondence Factor Analysis of Big Data Sets: A Case Study of 30 Million Words; and Contrasting Analytics using Apache Solr and Correspondence Analysis in R},
  author = {Fionn Murtagh},
  journal= {arXiv preprint arXiv:1507.01529},
  year   = {2015}
}

备注

38 pages, 17 figures