中文

Sifaka:基于搜索 API 之上的文本挖掘

信息检索 2018-10-09 v1

摘要

文本挖掘与分析软件已变得流行,但此类系统的软件架构却很少受到关注。它们通常通过使用专用软件和数据结构从零开始构建,这增加了其成本和复杂性。本演示论文描述了 Sifaka,一个使用现有应用程序编程接口(API)调用构建在标准搜索引擎索引之上的新型开源文本挖掘应用。索引集成了流行的标注软件库,以名词短语和命名实体增强全文索引;同时提供 n-gram。Sifaka 使人能够通过搜索、频率分析和共现分析快速探索和分析大型文本集合;并导入现有文档标签或交互式构建作为新概念正例或反例的文档集,执行特征选择,并导出与流行机器学习软件兼容的特征向量。Sifaka 证明了搜索引擎是文本挖掘应用的良好平台,同时也使常见的 IR 文本挖掘能力惠及编程技能较不普遍学科的研究人员。

关键词

引用

@article{arxiv.1810.02907,
  title  = {Sifaka: Text Mining Above a Search API},
  author = {Cameron VandenBerg and Jamie Callan},
  journal= {arXiv preprint arXiv:1810.02907},
  year   = {2018}
}

备注

5 pages, 4 figures