熵在数据分析与机器学习中的应用综述
机器学习
2025-03-06 v1 机器学习
概率论
摘要
自 19 世纪热力学学派以来,熵的概念也渗透到物理学和数学的其他领域,如经典与量子统计力学、信息论、概率论、动力系统理论和操动系统理论。具体而言,我们指的是经典熵:玻尔兹曼- Gibbs、von Neumann、香农、Kolmogorov-Sinai 和拓扑熵。除了其常见名称(我们简要描述了此综述),经典熵的另一共性是它们在各自领域及其延伸之外所发挥的重要作用。因此,随着时间的推移,许多其他熵的实例也被提出,大多数是针对特定目的而设计的。遵循当前用法,我们将它们——无论是经典还是新的——简单地称为熵。精确地说,本综述的主题是它们在数据分析和机器学习中的应用。之所以关注这些特定应用,是因为熵非常适合描述由有限状态过程或符号化信号生成的概率质量分布。因此,我们将关注定义为概率质量分布上正功能的熵,并提供一个回溯到香农和 Khinchin 的公理化表述。鉴于文献中存在大量熵,我们挑选了一组具代表性的熵,包括经典熵。本综述总结的应用细致地说明了熵在数据分析和机器学习中的强大功能与多样性。
引用
@article{arxiv.2503.02921,
title = {Applications of Entropy in Data Analysis and Machine Learning: A Review},
author = {Salomé A. Sepúveda Fontaine and José M. Amigó},
journal= {arXiv preprint arXiv:2503.02921},
year = {2025}
}
备注
39 pages, 3 figures, 282 references