中文

数字档案搜索与挖掘系统剖析

数字图书馆 2016-03-24 v1 计算与语言 信息检索

摘要

Samtla(Search And Mining Tools with Linguistic Analysis)是一个数字人文系统,与历史学家和语言学家合作设计,旨在通过近似短语搜索和文档比较来量化任何文本语料库的内容,以协助他们的研究工作。检索引擎使用基于字符的 n-gram 语言模型而非传统的基于词的模型,从而在语言无关的查询处理中实现极大的灵活性。索引实现为空间优化的基于字符的后缀树,并附带文档内容和元数据数据库。许多文本挖掘工具集成到系统中,允许研究人员发现文本模式、执行比较分析,并找出研究界当前流行的东西。在此我们描述 Samtla 系统的系统架构、用户界面、模型和算法以及数据存储。我们还展示了几个实际使用的案例研究,以及通过众包对系统排名性能的评估。

关键词

引用

@article{arxiv.1603.07150,
  title  = {The Anatomy of a Search and Mining System for Digital Archives},
  author = {Martyn Harris and Mark Levene and Dell Zhang and Dan Levene},
  journal= {arXiv preprint arXiv:1603.07150},
  year   = {2016}
}

备注

49 pages