基于课程引导的自适应递归训练加速技术
机器学习
2025-12-29 v3 人工智能
计算与语言
神经与进化计算
摘要
背景:递归推理模型通过迭代细化实现强大的性能,使小型网络能够匹配大型语言模型。然而,训练计算成本高昂,通常需要36个GPU小时才能完成数独极限题。现有模型使用固定的递归深度和统一的监督加权,导致训练效率低下。目标:我们提出CGAR(课程引导的自适应递归),将课程学习应用于架构深度。CGAR引入渐进深度课程(PDC),动态调整递归深度,并采用层次监督加权(HSW),对监督步骤应用指数衰减的重要性。方法:PDC实施三个阶段的计划,从浅层(2,1)过渡到完全深度(6,3)配置,实现41.4%的FLOPs降低。HSW对监督步骤应用指数衰减,实现40%的梯度方差降低并加速收敛。结果:在数独极限题上,CGAR实现训练速度提升1.71倍(从10.93小时缩短到6.38小时),仅有0.63%的准确率下降(从86.65%降至86.02%)。PDC单独实现2.26倍的加速,准确率为85.47%,显示出效率和质量的帕累托改进。HSW提供1.61倍的加速。CGAR训练的模型在推理效率方面表现优异,实现100%的停止准确率并减少11%的推理步骤。结论:CGAR使递归模型在有限硬件上实现高效训练。通过将深度作为一个计划参数来处理,它实现了显著的节省并防止过拟合,使这些模型在神经符号AI和程序综合中具有实际应用价值。
引用
@article{arxiv.2511.08653,
title = {Accelerating Training Speed of Tiny Recursive Models with Curriculum Guided Adaptive Recursion},
author = {Kaleem Ullah Qasim and Jiashu Zhang},
journal= {arXiv preprint arXiv:2511.08653},
year = {2025}
}