彩票票 hypothesis 与神经网络扩展规律的通用压缩理论
机器学习
2026-03-03 v2 无序系统与神经网络
信息论
机器学习
math.IT
摘要
在大规模模型训练中,性能通常按照参数数量和数据集大小的慢幂律进行扩展。一个根本性理论与实践问题是:是否可以用显著更小的模型和大幅减少的数据实现相当的性能。本文给出肯定且建设性的答案。我们证明,一个任意 permutation-invariant 的 d 个对象的函数可以渐近压缩为 polylog d 个对象的函数,误差趋于零,这是最优的压缩率。这一定理蕴含两个关键含义:(Ia) 大型神经网络可压缩为 polylog 宽度而保持其学习动力学;(Ib) 大型数据集可压缩为 polylog 大小而不改变对应模型的损失景观。含义 (Ia) 直接建立了动力学彩票票 hypothesis 的证明,即任何普通网络均可强压缩,使学习动力学和结果保持不变。含义 (Ib) 显示,形如 L~d^{-α} 的神经网络扩展规律可提升为任意快速幂律衰减,最终衰减至 exp(-α' d^{1/m})。
引用
@article{arxiv.2510.00504,
title = {A universal compression theory for lottery ticket hypothesis and neural scaling laws},
author = {Hong-Yi Wang and Di Luo and Tomaso Poggio and Isaac L. Chuang and Liu Ziyin},
journal= {arXiv preprint arXiv:2510.00504},
year = {2026}
}
备注
26 pages. Accepted by ICLR 2026 conference