Learn from your own latents and not from tokens: A sample-complexity theory
机器学习
2026-05-28 v1
摘要
从扩散模型到大型语言模型,生成模型在各类任务上实现了显著性能,但其训练数据规模远超生物学习者所需的量。一种替代范式正在涌现,即训练网络预测其自身对相关视图或被遮盖区域的latent表示,如data2vec和JEPA所示,这一思想与皮层的预测编码理论相关。尽管实证结果良好,但这些方法的理论理解仍有限。核心问题包括:latent prediction实际上在数据效率方面带来多少提升?将此类方法堆叠为多尺度层级是否有益?我们通过一种可计算的概率上下文无关语法作为数据,回答上述问题,该语法捕获自然语言和图像的组合结构。这种语法通过递归应用生产规则在深度为的隐藏符号树上生成可见token序列。对于此类数据,监督学习或token级自监督学习需要指数级的样本数才能恢复隐含树结构;我们证明,latent prediction只需对常数的样本数(最多 logarithmic因子)即可实现这一目标。我们通过(i)一种层次聚类算法、(ii)一个端到端神经网络,其预测-聚类模块通过梯度下降在每个层级预测自身latent,以及(iii)第一次对data2vec进行样本复杂度分析,证明其隐式执行了层次latent预测。这表明,诸如H-JEPA等显式堆叠方法在实际效果上是 largely redundant的。
引用
@article{arxiv.2605.27734,
title = {Learn from your own latents and not from tokens: A sample-complexity theory},
author = {Daniel J. Korchinski and Alessandro Favero and Matthieu Wyart},
journal= {arXiv preprint arXiv:2605.27734},
year = {2026}
}
备注
10 pages, 5 figures in main. 28 pages, 14 figures, 1 table in all