中文

面向时间序列、随机场及其他结构化数据的核距离度量

机器学习 2021-10-01 v1 机器学习

摘要

本文提出 kdiff,一种基于核的新颖度量,用于估计时间序列、随机场及其他形式结构化数据实例之间的距离。该度量基于这样一种思想:匹配仅在其支撑区域的一部分上重叠的分布。我们提出的度量受先前针对此类数据集提出且使用欧氏度量构造的 MPdist 的启发,而 kdiff 是使用非线性核距离构造的。此外,kdiff 考虑了实例间的自相似性与交叉相似性,并使用距离分布的下分位数来定义。将交叉相似性与自相似性进行比较,可以得到对噪声和相关信号局部遮挡更鲁棒的相似性度量。我们提出的度量 kdiff 是已知基于核的最大均值差异(MMD)距离在嵌入上估计的一种更一般形式。针对将嵌入分布建模为双组分混合物的聚类和分类问题,给出了使用 kdiff 作为距离度量的可分离性条件的若干理论结果。在合成与真实时间序列及图像数据的聚类中展示了应用,并将 kdiff 的性能与用于聚类的竞争距离度量进行了比较。

关键词

引用

@article{arxiv.2109.14752,
  title  = {Kernel distance measures for time series, random fields and other structured data},
  author = {Srinjoy Das and Hrushikesh Mhaskar and Alexander Cloninger},
  journal= {arXiv preprint arXiv:2109.14752},
  year   = {2021}
}