Semblance:一种基于秩的概率空间核方法用于生态位检测
机器学习
2019-09-20 v4
摘要
在数据科学中,确定观测之间的邻近性对于聚类、信息检索和分类等许多下游分析至关重要。然而,当数据概率空间的底层结构不明确时,用于计算数据点间相似度的函数往往被随意选择。在此,我们提出一种新颖的邻近性概念——Semblance,它利用所有观测上的经验分布来刻画每一对观测之间的相似性。Semblance 的优势在于其无分布的构造形式,以及能够通过相对于落在数据分布中心的观测对、更强调落在数据分布边缘的观测对之间的相似性来检测生态位特征。我们证明 Semblance 是一个有效的 Mercer 核,从而允许其在基于核的学习机中被原则性地使用。Semblance 可应用于任意数据模态,并通过模拟以及来自差异极大的应用的三个真实案例研究——即使用单细胞 RNA 测序进行细胞类型分类、筛选房地产投资正收益的预测因子、以及图像压缩——展示了其相对于传统方法始终更优的性能。
引用
@article{arxiv.1808.02061,
title = {Semblance: A Rank-Based Kernel on Probability Spaces for Niche Detection},
author = {Divyansh Agarwal and Nancy R. Zhang},
journal= {arXiv preprint arXiv:1808.02061},
year = {2019}
}