基于“相似性协方差”的向量关联度量
统计方法学
2013-02-05 v4
摘要
本研究提出的“最大相似性相关”定义受Szekely等人关于“距离协方差”的开创性工作启发(Ann. Statist. 2007, 35: 2769-2794; Ann. Appl. Stat. 2009, 3: 1236-1265)。我们使用“相似性”代替Szekely等人所用的欧氏距离“d”,相似性定义为“exp(-d/s)”,其中尺度参数s>0控制相似性随距离衰减的速度。通过最大化相似性相关来选择尺度参数。使用“相似性”的动机源于谱聚类理论(参见Ng等人2001,Advances in Neural Information Processing Systems 14: 849-856)。我们证明,对于较大的尺度参数,特定形式的相似性相关与距离相关渐近等价。此外,我们将相似性相关扩展到复值向量之间的相干性,包括将其分解为实部和虚部贡献。通过几个简单例子比较距离相关和相似性相关。例如,无噪声直线上的点给出距离相关和相似性相关值均为1;但无噪声圆上的点产生接近零的距离相关(dCorr=0.02),而相似性相关明显非零(sCorr=0.36)。与距离方法不同,相似性更重视小距离,从而强调函数关系的局部性质。本文是一项初步的实证研究,表明新的相似性关联在实践中有一些优于距离关联的明显优势。为保证研究的可重复性,实现所有方法的软件代码(使用Lazarus Free-Pascal,网址:www.lazarus.freepascal.org)以及所有测试数据均可免费获取:sites.google.com/site/pascualmarqui/home/similaritycovariance。
引用
@article{arxiv.1301.4291,
title = {A measure of association between vectors based on "similarity covariance"},
author = {Roberto D. Pascual-Marqui and Dietrich Lehmann and Kieko Kochi and Toshihiko Kinoshita and Naoto Yamada},
journal= {arXiv preprint arXiv:1301.4291},
year = {2013}
}
备注
Pre-print; Technical report; 2013-01-18