ResNEsts 与 DenseNEsts:具有改进表示保证的基于块的 DNN 模型
机器学习
2022-01-19 v2 神经与进化计算
信号处理
最优化与控制
机器学习
摘要
近期文献中用于证明残差网络(ResNets)优于线性预测器的模型实际上不同于计算机视觉中广泛使用的标准 ResNets。除了标量值输出或单残差块等假设外,这些模型在馈入最终仿射层的最后残差表示处没有非线性。为厘清此种非线性差异并揭示线性估计性质,我们通过从标准 ResNets 中简单去除最后残差表示处的非线性来定义 ResNEsts,即残差非线性估计器。我们证明,具有瓶颈块的宽 ResNEsts 总能保证标准 ResNets 旨在实现的非常理想的训练性质,即给定相同基元素集合时增加更多块不会降低性能。为证明这一点,我们首先认识到 ResNEsts 是受基学习与直线预测中耦合问题限制的基函数模型。然后,为将预测权重与基学习解耦,我们构建了一种称为增广 ResNEst(A-ResNEst)的特殊架构,其总能保证增加块时性能不变差。因此,这样的 A-ResNEst 为使用相应基的 ResNEst 建立了经验风险下界。我们的结果表明 ResNEsts 确实存在特征复用递减的问题;然而,它可通过充分扩展或加宽输入空间来避免,从而带来上述理想性质。受已被证明优于 ResNets 的 DenseNets 启发,我们还提出了一种相应的新模型,称为稠密连接非线性估计器(DenseNEst)。我们证明任何 DenseNEst 都可表示为具有瓶颈块的宽 ResNEst。与 ResNEsts 不同,DenseNEsts 无需任何特殊架构重设计即可展现该理想性质。
引用
@article{arxiv.2111.05496,
title = {ResNEsts and DenseNEsts: Block-based DNN Models with Improved Representation Guarantees},
author = {Kuan-Lin Chen and Ching-Hua Lee and Harinath Garudadri and Bhaskar D. Rao},
journal= {arXiv preprint arXiv:2111.05496},
year = {2022}
}
备注
24 pages. Accepted by NeurIPS 2021. Remark 1 clarified and typos corrected