中文

基于求解器-验证器间隙的大型语言模型自我改进训练动力学理论建模

量子物理 2025-07-02 v1 核理论

摘要

自我改进是大型语言模型(LLM)领域的重要技术,旨在无需依赖外部数据即可提升LLM性能。尽管其重要性已得到广泛认可,但关于LLM在自我改进过程中性能如何演化的问题仍鲜有探讨。本文通过求解器-验证器间隙的概念,对自我改进的训练动力学进行理论建模。这一理论框架源于这样一种猜想:LLM性能提升的来源是其求解器能力与验证器能力之间的差距。基于该理论框架,我们进一步展示了如何建模整个训练轨迹。这一框架允许通过拟合理论模型来量化自我改进的能力限制。我们在各种LLM和数据集上验证了该理论框架的有效性。除了自我改进,我们还扩展了分析,探讨了外部数据在这些动力学中的影响。值得注意的是,我们发现,在外部数据有限的条件下,外部数据可以在任何阶段被利用,而不会显著影响最终性能,这与经验观察相吻合。

关键词

引用

@article{arxiv.2507.00074,
  title  = {Studying few cluster resonances with quantum neural network driven iterative Harrow-Hassidim-Lloyd algorithm},
  author = {Hantao Zhang and Dong Bai and Zhongzhou Ren},
  journal= {arXiv preprint arXiv:2507.00074},
  year   = {2025}
}