中文

游戏玩家能否训练数学推理模型?

计算与语言 2025-06-11 v1 人工智能 机器学习

摘要

尽管大语言模型(LLM)在包括数学推理在内的各种任务中已取得显著性能,但其开发通常需要极高的计算资源。近期的进展降低了训练高性能模型的成本,但这些方法仍然依赖高端硬件集群。在本文中,我们证明单个普通游戏GPU即可训练一个扎实的数学推理模型,通过整合强化学习和内存优化技术。具体而言,我们在RTX 3080 Ti(16GB显存)上训练了一个1.5B参数的数学推理模型,在资源受限环境中,其在数学推理基准测试上的表现与数倍更大的模型相当甚至更好。我们的结果挑战了最先进数学推理需要大规模基础设施的范式,使高性能AI研究的获取民主化。https://github.com/shinandrew/YouronMath.

关键词

引用

@article{arxiv.2506.08935,
  title  = {Can A Gamer Train A Mathematical Reasoning Model?},
  author = {Andrew Shin},
  journal= {arXiv preprint arXiv:2506.08935},
  year   = {2025}
}