随机层次模型的可证学习与层次浅到深链
机器学习
2026-01-28 v1 机器学习
摘要
深度学习的经验成功往往归因于深度网络能够利用数据中的层次结构,在各层中构建日益复杂的特征。然而,尽管深度学习理论取得了显著进展,大多数优化结果仍仅关注两层或三层的网络,深层模型中层次学习的理论理解仍有限。这自然引出一个问题:我们能否证明深度网络经过梯度方法训练后能够高效地利用层次结构?本文我们考虑随机层次模型——一种由 arXiv:2307.02129 引入的层次上下文无关语法,据 conjectures 称其可分离浅层网络与深度网络。我们证明,在 mild 条件下,深度卷积网络可以被有效训练以学习该函数类。我们的证明基于一个一般性观察:如果中间层能够从标签获得干净的信号且相关特征可弱可辨识,则对每一层进行的层次训练足以层次化地学习目标函数。
引用
@article{arxiv.2601.19756,
title = {Provable Learning of Random Hierarchy Models and Hierarchical Shallow-to-Deep Chaining},
author = {Yunwei Ren and Yatin Dandi and Florent Krzakala and Jason D. Lee},
journal= {arXiv preprint arXiv:2601.19756},
year = {2026}
}