对距离度量的信息含量进行排序
机器学习
2022-05-27 v2 信息论
机器学习
math.IT
摘要
真实世界数据通常包含大量特征,这些特征在性质、相关性与度量单位上往往异构。在评估数据点间相似性时,可利用这些特征的子集构建各种距离度量。在许多统计学习方法中,尤其是当数据稀疏时,使用最少的特征但仍保留关于系统的充足信息至关重要。我们引入一种统计检验,可评估使用两种不同距离度量时所保留的相对信息,并判定它们是等价、独立,还是其中之一更具信息量。这进而允许从一组候选中找出最具信息量的距离度量。该方法被应用于寻找控制 Covid-19 疫情的最相关政策变量,以及寻找原子结构的紧凑而具信息量的表示,但其在众多科学分支中的潜在应用十分广泛。
引用
@article{arxiv.2104.15079,
title = {Ranking the information content of distance measures},
author = {Aldo Glielmo and Claudio Zeni and Bingqing Cheng and Gabor Csanyi and Alessandro Laio},
journal= {arXiv preprint arXiv:2104.15079},
year = {2022}
}