中文

数据均匀性提升训练效率并突破NTK范式: 一种收敛框架

机器学习 2025-09-30 v2 人工智能 最优化与控制 机器学习

摘要

数据选择在数据驱动决策中发挥关键作用,包括大型语言模型(LLM),且通常具有任务依赖性。诸如数据质量和多样性等属性已广泛研究,已知其可提升模型性能。然而,是否存在一种量化且普适的数据选择原则,能够在尤其是复杂任务中持续改善性能,仍不明确。本文证明,选择更均匀分布的数据可提升训练效率并增强性能。具体而言,我们证明更均匀(更不偏)的分布导致数据点之间最小的两两距离hmin h_{\min} 更大,并且证明hmin h_{\min} 较小可减缓梯度下降(GD)的训练动力学。此外,我们理论上表明,神经网络的近似误差随hmin h_{\min} 的增大而减小。我们的分析引入了超越神经张量核(NTK)范式的收敛框架,适用于广泛的网络结构,包括变换器,且无需Lipschitz光滑性。该框架进一步为深度神经网络架构中残差连接和函数组合提供了理论依据。最后,我们在各种设置下进行了全面实验,包括不同的优化策略、模型规模和训练数据集。结果一致显示,通过最大化两两距离选择数据显著加速训练,并在LLM中实现相当或更好的性能。代码与数据集链接: https://github.com/SafeRL-Lab/data-uniformity。

关键词

引用

@article{arxiv.2506.24120,
  title  = {Data Uniformity Improves Training Efficiency and More, with a Convergence Framework Beyond the NTK Regime},
  author = {Yuqing Wang and Shangding Gu},
  journal= {arXiv preprint arXiv:2506.24120},
  year   = {2025}
}