中文

超越参数:探索虚拟逻辑深度的规模效应

人工智能 2025-10-14 v3

摘要

扩大大型语言模型的规模通常涉及三个维度:深度、宽度和参数数量。本文探索了第四个维度——虚拟逻辑深度 (VLD),通过重复使用权重而不改变参数数量来增加有效算法深度。虽然参数重复使用并非新事物,但其在规模中的作用一直未得到充分探讨。不同于最近按 token 方式进行的测试时方法,VLD 改变训练和推理期间内部计算图的结构。通过受控实验,我们获得了三个关键见解。(1) 知识容量 vs 参数:在固定参数数量下,VLD 几乎不改变知识容量,而在模型之间,容量仍随参数数量而扩展。(2) 推理 vs 重复:正确实现的 VLD 在不增加更多参数的情况下显著提高推理能力,使推理与规模分离。这表明这是一条超越 token 级测试时方法的新规模路径。(3) 鲁棒性与普适性:推理收益在不同架构和重复方案中保持持久,表明 VLD 捕获了通用的规模行为。这些结果为未来的规模策略提供了见解,并引出一个更深层的问题:超级智能是否需要不断增大的模型,还是可以通过重复参数和增加逻辑深度来实现?我们认为许多规模中的未知动力学仍需探索。代码地址:https://anonymous.4open.science/r/virtual_logical_depth-8024/。

关键词

引用

@article{arxiv.2506.18233,
  title  = {Beyond Parameters: Exploring Virtual Logic Depth for Scaling Laws},
  author = {Ruike Zhu and Hanwen Zhang and Kevin Li and Tianyu Shi and Yiqun Duan and Chi Wang and Tianyi Zhou and Arindam Banerjee and Zengyi Qin},
  journal= {arXiv preprint arXiv:2506.18233},
  year   = {2025}
}