中文

通过可变大小可压缩性的数据依赖泛化界

机器学习 2024-06-12 v3 信息论 机器学习 math.IT

摘要

在本文中,我们通过新引入的“可变大小可压缩性”框架的视角,建立了关于泛化误差的新的数据依赖上界。在该框架中,算法的泛化误差与其输入数据的可变大小“压缩率”相关联。这表明所得到的界依赖于给定输入数据的经验测度,而非其未知分布。我们建立的新的泛化界包括尾界、期望上的尾界以及期望内界。此外,表明我们的框架还允许推导关于输入数据与输出假设随机变量的任意函数的通用界。特别地,这些通用界被证明包含并可能改进若干现有的 PAC-Bayes 和基于数据依赖内蕴维度的界,后者作为特例被恢复,从而揭示了我们方法的统一特征。例如,建立了一个新的基于数据依赖内蕴维度的界,它将泛化误差与优化轨迹联系起来,并揭示了与过程的率失真维数、过程的 Rényi 信息维数以及度量平均维数的各种有趣联系。

关键词

引用

@article{arxiv.2303.05369,
  title  = {Data-dependent Generalization Bounds via Variable-Size Compressibility},
  author = {Milad Sefidgaran and Abdellatif Zaidi},
  journal= {arXiv preprint arXiv:2303.05369},
  year   = {2024}
}

备注

Accepted for publication in IEEE Transactions on Information Theory