中文

线性成本下的度量与非度量邻近变换

数据结构与算法 2014-11-07 v1

摘要

特定领域的(不)相似度或邻近度量(例如用于序列数据比对算法的度量)常用于分析复杂数据对象并涵盖特定领域的数据属性。在没有底层向量空间的情况下,这些数据仅以成对(不)相似度的形式给出。针对此类数据的少数可用方法主要关注相似度,且无法扩展至大规模数据集。核方法对于度量相似度矩阵非常有效,即使在大规模下也是如此,但从非度量(不)相似度开始则需要昂贵的变换。我们提出了一种整合 Nystroem 近似、潜在双重中心化和本征值校正的组合方法,以线性成本(相对于样本数量)获得有效的核矩阵。通过所提出的方法,有效的核方法变得可行。在多个大型(不)相似度数据集上的实验表明,所提出的方法在保持具有竞争力的模型精度的同时,实现了比标准策略好得多的运行时间性能。主要贡献是一种高效且准确的技术,能够以线性成本将(潜在非度量的)大规模不相似度矩阵转换为近似的正半定核矩阵。

关键词

引用

@article{arxiv.1411.1646,
  title  = {Metric and non-metric proximity transformations at linear costs},
  author = {Andrej Gisbrecht and Frank-Michael Schleif},
  journal= {arXiv preprint arXiv:1411.1646},
  year   = {2014}
}