中文

基于“大多数层相似”的逆深度比例

机器学习 2026-02-06 v1 人工智能 动力系统 机器学习

摘要

神经网络比例规律关联损失与模型规模,但深度与宽度可能以不同方式贡献于性能,亟需更细致的研究。本文通过分析大语言模型(LLMs)与小型残差网络,量化深度对损失的影响。我们发现 LLMs 中的损失随深度成反比,这可能源于功能相似的层通过集体平均降低误差,而非通过组合学习或离散化光滑动力学实现。该运行模式虽低效却稳健,可能源于残差网络的架构偏置以及目标函数不适合光滑动力学。研究表明,提高 LLM 效率可能需要架构创新,以鼓励深度的组合性使用。

关键词

引用

@article{arxiv.2602.05970,
  title  = {Inverse Depth Scaling From Most Layers Being Similar},
  author = {Yizhou Liu and Sara Kangaslahti and Ziming Liu and Jeff Gore},
  journal= {arXiv preprint arXiv:2602.05970},
  year   = {2026}
}

备注

23 pages, 24 figures