维度的祝福:数据统计物理的数学基础
机器学习
2018-03-20 v1
摘要
测度集中现象于十九世纪末至二十世纪初作为统计力学的数学背景被发现,随后在二十至二十一世纪的数学中得到探索。二十一世纪初,人们清楚认识到在机器学习中恰当利用这些现象可将维数灾难转化为维度祝福。本文总结了近期发现的测度集中现象,这些现象极大简化了高维中的一些机器学习问题,并允许我们修正传统人工智能系统。经典的测度集中定理指出,独立同分布随机点集中在靠近曲面(球面或球面的赤道、能量或其他 Lipschitz 函数的平均或中位水平集等)的薄层内。新的随机分离定理描述了这些薄层的精细结构:随机点不仅集中在薄层内,而且即使对于指数级大的随机集,也都与集合的其余部分线性可分。用于分离点的线性泛函可选为线性 Fisher 判别的形式。所有人工智能系统都会出错。非破坏性修正需要通过简单且鲁棒的分类器将出错的情况(样本)与对应正确行为的样本分离。随机分离定理为我们提供了此类分类器以及用于学习的非迭代(一次性)过程。
引用
@article{arxiv.1801.03421,
title = {Blessing of dimensionality: mathematical foundations of the statistical physics of data},
author = {A. N. Gorban and I. Y. Tyukin},
journal= {arXiv preprint arXiv:1801.03421},
year = {2018}
}
备注
Accepted for publication in Philosophical Transactions of the Royal Society A, 2018. Comprises of 17 pages and 4 figures