中文

基于词典的方法用于信息提取

统计力学 2009-11-10 v2 其他凝聚态物理 信息检索 基因组学 其他定量生物学

摘要

本文提出了一种通用的数据压缩技术特征的信息提取方法。我们首先定义并关注所谓“词典”序列的特性。词典本身具有很大的兴趣,研究其特性对于调查其提取的序列(例如 DNA 字符串)的属性具有极大价值。我们随后描述了一种字符串比较程序,基于词典创建序列(或“人造文本”)之间的比较,能在多个情境中取得优异结果。最后,我们呈现了一些关于自洽分类问题的结果。

关键词

引用

@article{arxiv.cond-mat/0402581,
  title  = {Dictionary based methods for information extraction},
  author = {A. Baronchelli and E. Caglioti and V. Loreto and E. Pizzi},
  journal= {arXiv preprint arXiv:cond-mat/0402581},
  year   = {2009}
}

备注

7 pages, Latex, elsart style