中文

语义蒸馏:一种基于上下文特异性对对象进行聚类的方法

概率论 2007-10-09 v2 数据库 统计理论 定量方法 机器学习 统计理论

摘要

从事信息检索(IR)的计算机科学家早在很久以前就开发了用于数据挖掘、潜在语义分析、数据库上下文搜索等的技术。各学科的实验科学家在必须分析大量原始实验数据(天文的、物理的、生物的等)时,已经开发了强大的方法来进行统计分析以及对对象进行聚类、归类和分类。最后,物理学家发展了量子测量理论,将查询的逻辑、代数和概率方面统一到单一的形式体系中。本文的目的有双重:首先,表明当在抽象层面上表述时,来自IR、统计数据分析和物理测量理论的问题非常相似,因此可以有益地相互借鉴;其次,提出一种新的模糊层次聚类方法,称为\textit{语义蒸馏}——深受量子测量理论启发——我们开发此方法用于分析来自DNA阵列各类实验的原始数据。我们通过分析DNA阵列实验并根据其特异性对阵列中的基因进行聚类来说明该方法。

关键词

引用

@article{arxiv.0710.1203,
  title  = {Semantic distillation: a method for clustering objects by their contextual specificity},
  author = {Thomas Sierocinski and Anthony Le Béchec and Nathalie Théret and Dimitri Petritis},
  journal= {arXiv preprint arXiv:0710.1203},
  year   = {2007}
}

备注

Accepted for publication in Studies in Computational Intelligence, Springer-Verlag