准静态深度神经网络能量使用的热力学下界
统计力学
2025-12-09 v3 机器学习
数据分析、统计与概率
神经元与认知
摘要
深度神经网络(DNN)的快速增长使其在训练和推理过程中的能量使用受到越来越多的关注。本文通过将现代前馈架构映射到物理自由能泛函上,建立了准静态模拟 DNN 中能量消耗的热力学下界。该框架为准静态 DNN 提供了直接的统计力学解释。因此,推理可以以热力学可逆的方式进行,具有消失的最小能量代价,这与约束数字硬件的 Landauer 极限形成对比。重要的是,推理对应于松弛到唯一的自由能最小值 F_{\min}=0,使得所有约束都能在不产生残余应力的情况下得到满足。相比之下,训练过度约束了系统:同时固定输入和输出会产生应力,这些应力通过架构向后传播,复现了反向传播的规则。随后参数退火松弛这些应力,提供了一条无需显式损失函数的纯物理学习路径。我们进一步推导出训练能量的通用下界 E < 2NDkT,该下界同时与可训练参数数量和数据集规模成正比。
引用
@article{arxiv.2503.09980,
title = {Thermodynamic bounds on energy use in quasi-static Deep Neural Networks},
author = {Alexei V. Tkachenko},
journal= {arXiv preprint arXiv:2503.09980},
year = {2025}
}
备注
6 pages, 2 figure, 1 table