中文

SGD 的过程张量断层:通过可区分性后流测量非马尔可夫记忆

机器学习 2026-01-26 v1 人工智能

摘要

本工作提出将神经网络训练建模为一种\emph{过程张量}:一种将一系列可控仪器(批量选择、数据增广、优化器微步)映射到训练模型可观测量的多时间映射。基于这种操作视角,我们引入一种基于\emph{可区分性后流}的简单、模型无关的训练记忆见证器。在受控的两步协议中,我们比较一次干预与两次干预后的结果分布;增加 ΔBF=D2D1>0\Delta_{\mathrm{BF}} = D_2 - D_1>0(其中 D{TV,JS,H}D\in\{\mathrm{TV}, \mathrm{JS}, \mathrm{H}\} 在固定探针集合上的softmax预测上测量)来证实非马尔可夫性。我们观察到在紧密的自助置信区间内观察到一致的正向后流,在更高的动量、更大的批量重叠和更多的微步下被放大,在\emph{因果中断}(重置优化器状态)下消亡,直接归因于优化器/数据状态记忆。该见证器在TV/JS/Hellinger之间具有鲁棒性、计算成本低、且无需架构变更。我们将其定位为一种\emph{测量}贡献:一种原则性的诊断工具和实证证据,表明实际的SGD偏离了马尔可夫理想化。一个探索性案例研究说明了微观信号如何为课程排序提供信息。\emph\"数据顺序重要\""变成一个带有置信区间的可测试算子;我们的框架为通过其诱导训练记忆比较优化器、课程和时间表提供了 common stage。

关键词

引用

@article{arxiv.2601.16563,
  title  = {Process-Tensor Tomography of SGD: Measuring Non-Markovian Memory via Back-Flow of Distinguishability},
  author = {Vasileios Sevetlidis and George Pavlidis},
  journal= {arXiv preprint arXiv:2601.16563},
  year   = {2026}
}

备注

to be published in the 29th International Conference on Artificial Intelligence and Statistics, in Proceedings of Machine Learning Research