通过高斯互信息的最优样本测试实现高斯树模型的高效样本最优学习
机器学习
2024-11-19 v1 数据结构与算法
机器学习
摘要
学习高维分布是机器学习和统计学中的一个重大挑战。经典研究主要集中在对这类数据在适当假设下的渐近分析。虽然现有工作[Bhattacharyya et al.: SICOMP 2023, Daskalakis et al.: STOC 2021, Choo et al.: ALT 2024]专注于离散分布,但当前工作解决了高斯分布的树结构学习问题,提供了具有坚实理论保证的高效算法。这一点至关重要,因为现实世界的分布通常是连续的,并且与先前工作中研究的离散场景不同。在这项工作中,我们设计了一个针对高斯随机变量的条件互信息测试器,该测试器可以测试两个高斯随机变量是否独立,或者它们的条件互信息是否至少为某个参数ε∈(0,1),使用O(ε^{-1})个样本,我们证明这是接近最优的。相比之下,加性估计需要Ω(ε^{-2})个样本。我们的上界技术使用了对一对适当变换后的随机变量进行线性回归。重要的是,我们证明了条件互信息的链式法则对于估计的(条件)互信息仍然成立。作为这种互信息测试器的一个应用,我们给出了一种高效的ε-近似结构学习算法,用于n变量高斯树模型,该算法需要Θ̃(nε^{-1})个样本,我们再次证明这是接近最优的。相比之下,当底层高斯模型未知为树结构时,我们证明需要Θ̃(n^2ε^{-2})个样本才能输出一个ε-近似的树结构。我们进行了大量实验,证实了我们的理论收敛界。
引用
@article{arxiv.2411.11516,
title = {Efficient Sample-optimal Learning of Gaussian Tree Models via Sample-optimal Testing of Gaussian Mutual Information},
author = {Sutanu Gayen and Sanket Kale and Sayantan Sen},
journal= {arXiv preprint arXiv:2411.11516},
year = {2024}
}
备注
47 pages, 16 figures, abstract shortened as per arXiv criteria