中文

无监督学习中泛化误差的权衡

统计力学 2023-09-13 v2 机器学习

摘要

寻找最小化泛化误差(GE)的最优模型复杂度是机器学习的关键问题。对于常规监督学习,该任务通常涉及偏差-方差权衡:通过使模型更复杂来降低偏差会招致方差增大。同时,关于无监督学习是否存在相同权衡的研究甚少。本研究中,我们提出无监督学习普遍展现 GE 的双组分权衡,即模型误差与数据误差——使用更复杂模型以数据误差为代价降低模型误差,且对于更小的训练数据集数据误差扮演更显著角色。这通过训练受限玻尔兹曼机在给定温度下生成二维伊辛模型构型以及具有给定进出率的完全不对称简单排他过程得到佐证。我们的结果还表明,当待学习数据更复杂时,最优模型往往更复杂。

关键词

引用

@article{arxiv.2303.05718,
  title  = {Tradeoff of generalization error in unsupervised learning},
  author = {Gilhan Kim and Hojun Lee and Junghyo Jo and Yongjoo Baek},
  journal= {arXiv preprint arXiv:2303.05718},
  year   = {2023}
}

备注

15 pages, 7 figures