中文

ReLU和softplus神经网络作为零和轮次游戏

机器学习 2025-12-24 v1 计算机科学与博弈论 最优化与控制

摘要

我们表明,ReLU神经网络的输出可被解释为零和轮次、停止游戏的值,我们称为ReLU net游戏。该游戏的运行方向与网络相反,网络的输入作为该游戏的终端奖励。在事实上,评估网络等同于运行Shapley-Bellman逆向递归,该游戏的值。使用该游戏值表达式作为相对于由转移概率和一对最优政策诱导的路径度量下的预期总报酬,我们推导了网络输出的离散Feynman-Kac类型路径积分公式。这种游戏论表示可用于从输入的界限推导输出界限,利用Shapley算子的单调性,并通过用作证书的政策来验证鲁棒性属性。此外,训练神经网络转化为逆游戏问题:给定终端奖励和相应值的配对,寻求能够再现这些值的游戏的转移概率和奖励。最后,我们表明,类似方法同样适用于具有Softplus激活函数的神经网络,其中ReLU net游戏被其熵正则化所取代。

关键词

引用

@article{arxiv.2512.20582,
  title  = {Relu and softplus neural nets as zero-sum turn-based games},
  author = {Stephane Gaubert and Yiannis Vlassopoulos},
  journal= {arXiv preprint arXiv:2512.20582},
  year   = {2025}
}

备注

24 pages, 2 figures