中文

对象相似性与词语意义

计算机视觉与模式识别 2007-05-23 v1 信息检索

摘要

我们调查了压缩基、无参数、在数据挖掘、模式识别、学习与自动语义提取中有用的相似性距离 measure 的新兴领域。给定集合上一族距离,若某距离在该族中在特定精度下对该族内所有距离都有下限(即在该族中该距离在该集合中每两个对象之间的最优距离上限为所述精度),则称该距离在该族中是普适的(我们不要求普适距离属于该族)。我们考虑两种类型的对象的相似性距离:一种是包含其全部意义的字面对象,如基因组或书籍;另一种是对象的名称。后者可能像前者一样具有字面实现,但也可能是抽象的,如“red”或“christianity”。对于前者,我们考虑一族可计算距离 measure,这些 measure 对应于表达特定特征相似性的参数;也对应于由 web 用户生成的、针对特定语义关系的距离 measure(这些关系涉及所指对象的名称)。对于这两族,我们给出普适相似性距离 measure,将该族内的所有特定距离 measure 纳入其中。在前一种情况下,普适距离基于压缩;在后一种情况下,基于与搜索词相关的 Google 页面计数。在两种情况下,大规模实验都给出了该方法可行性的证据。

关键词

引用

@article{arxiv.cs/0602065,
  title  = {Similarity of Objects and the Meaning of Words},
  author = {Rudi Cilibrasi and Paul Vitanyi},
  journal= {arXiv preprint arXiv:cs/0602065},
  year   = {2007}
}

备注

LaTeX, 25 pages, 7 figures. Proc. 3rd Conf. Theory and Applications of Models of Computation (TAMC), 15-20 May, 2006, Beijing, China (Invited paper) This is an extended version of the 5-page abstract cs.IR/0504089