中文

从谱动力学视角看数据聚集:静态极限、动态加速与实用准则

机器学习 2025-12-03 v1 人工智能

摘要

大规模神经模型正通过数据修剪、合成数据生成、跨模型蒸馏、从人类反馈中强化学习 (RLHF) 以及基于难度的抽样等数据聚集策略进行训练。虽然其中一些数据聚集策略可靠地提高训练效率和下游性能,但其他一些则未能提供有意义的收益——最显著的是自生成的合成数据,后者往往增加数据集规模而不提升模型能力。我们将数据聚集形式化为对抽样分布进行重新加权,并将其效果映射到数据诱导算子的特征结构上。我们的第一个主要结果表明,**静态修剪会导致算子受限,因此不能改变谱尾指数**;它最多只能提供有限区域的改进,不能改变渐近神经比例。我们的第二个结果分析了**时间依赖的数据聚集**,表明一个理想的准则能够跟踪谱残并持续重新归一化尾部,可证明地加速学习——尽管实际系统只能近似这种行为。

关键词

引用

@article{arxiv.2512.02409,
  title  = {Data Curation Through the Lens of Spectral Dynamics: Static Limits, Dynamic Acceleration, and Practical Oracles},
  author = {Yizhou Zhang and Lun Du},
  journal= {arXiv preprint arXiv:2512.02409},
  year   = {2025}
}