中文

深度神经网络训练中的记忆:机制、证据与测量缺口

机器学习 2026-01-30 v1

摘要

现代深度学习训练并非无记忆。更新取决于优化器动力学、平均化、数据顺序策略(随机重洗牌与有放回、分阶段数据增强与回放)、非凸路径以及辅助状态(教师指数移动平均/SWA、对比队列、BatchNorm 统计)。本综述按来源、生命周期和可见性对机制进行组织。它引入了基于种子配对的函数空间因果估计量;可移植的扰动基元(动量/Adam/EMA/BN 的携带/重置、顺序窗口交换、队列/教师调整);以及带有审计制品(顺序哈希、缓冲区/BN 校验和、RNG 合约)的报告清单。结论是为可移植、因果、不确定性感知的测量协议,归因于训练历史在不同模型、数据和情景中有多大影响。

关键词

引用

@article{arxiv.2601.21624,
  title  = {Training Memory in Deep Neural Networks: Mechanisms, Evidence, and Measurement Gaps},
  author = {Vasileios Sevetlidis and George Pavlidis},
  journal= {arXiv preprint arXiv:2601.21624},
  year   = {2026}
}