中文

在常规聚类算法中引入承载气候数据知识的专家偏差

机器学习 2020-06-11 v1 大气与海洋物理 机器学习

摘要

为帮助物理学家拓展对小安的列斯群岛气候的认知,我们旨在通过对风速和累积降雨数据集进行聚类分析来识别时空配置。但我们表明,在常规聚类方法(如 K-Means(KMS)和层次凝聚聚类(HAC))中使用 L2 范数会引发不良效应。因此,我们提议用一种称为专家偏差(ED)的不相似度度量替代欧氏距离(L2)。基于对称化 Kullback-Leibler 散度,ED 融合了观测物理参数与气候知识的属性。该度量有助于比较对应地理区域、受大气结构影响的四个区块的直方图。我们对使用 ED 和 L2 所获聚类的内部同质性与分离度进行了联合评估。借助轮廓指数比较的结果显示出五个具有高指数的聚类。对于两个可用数据集,可见不同于 KMS-L2,KMS-ED 有利地区分了每日情境,赋予算法发现的聚类更多物理意义。在 KMS-ED 代表性元素的空间分析中观察到区块效应。ED 能够产生不同配置,使常见大气结构清晰可辨。大气物理学家可根据大气结构解释各聚类对特定区域的影响位置。KMS-L2 无法带来此种可解释性,因为其表征的情境在空间上相当平滑。该气候学研究阐明了使用 ED 作为一种新方法的优势。

关键词

引用

@article{arxiv.2006.05603,
  title  = {Using an expert deviation carrying the knowledge of climate data in usual clustering algorithms},
  author = {Emmanuel Biabiany and Vincent Page and Didier Bernard and Hélène Paugam-Moisy},
  journal= {arXiv preprint arXiv:2006.05603},
  year   = {2020}
}