中文

通过聚类和香农熵最小化实现最大信息提取

数据分析、统计与概率 2026-01-01 v7

摘要

在对任何类型系统的数据分析中,实现从数据中最大限度地提取信息并非易事。对所 studied 系统了解或用户经验的先验知识,通常是对成功信息提取信心的构建基础。然而,定义确保从数据中实现最大信息提取的稳健且客观的标准,较难。本文引入一种数据驱动方法,采用香农熵作为可迁移的度量标准,对通过聚类提取数据中的最大信息(Maximum Information Extraction, MInE)进行评估与量化。该方法具有普适性,可几乎应用于任何类型的数据或系统。我们以分子动力学仿真中水和冰在固液相变温度下的共存时间序列数据为例,演示其效率。该方法允许量化数据分布(时不变组成部分)中包含的信息,以及通过将数据分析为时间序列所能获得的额外信息增益(即,考虑数据时间相关性所包含的信息)。可有效分辨和分类的不同微域由各自的熵进行特征化,发现与已知实验热力学参数一致。第二个测试案例表明,MInE 方法同样适用于高维数据集,清晰显示,在高维分析中包含少量信息但噪声较大的额外成分/特征,可能不仅无用,甚至对实现最大信息提取造成负面影响。该方法提供了一种无参数的数据分析方法,以及用于从数据中研究任何类型系统的定量指标。

关键词

引用

@article{arxiv.2504.12990,
  title  = {Maximum Information Extraction Via Clustering and Minimization of Shannon Entropy},
  author = {Matteo Becchi and Giovanni Maria Pavan},
  journal= {arXiv preprint arXiv:2504.12990},
  year   = {2026}
}

备注

Main text 11 pages, 4 figures; Supplemental Materials 3 pages, 2 figures. v7: main text has been expanded, one figure added