中文

ResNEsts 与 DenseNEsts:具有改进表示保证的基于块的 DNN 模型

机器学习 2022-01-19 v2 神经与进化计算 信号处理 最优化与控制 机器学习

摘要

近期文献中用于证明残差网络(ResNets)优于线性预测器的模型实际上不同于计算机视觉中广泛使用的标准 ResNets。除了标量值输出或单残差块等假设外,这些模型在馈入最终仿射层的最后残差表示处没有非线性。为厘清此种非线性差异并揭示线性估计性质,我们通过从标准 ResNets 中简单去除最后残差表示处的非线性来定义 ResNEsts,即残差非线性估计器。我们证明,具有瓶颈块的宽 ResNEsts 总能保证标准 ResNets 旨在实现的非常理想的训练性质,即给定相同基元素集合时增加更多块不会降低性能。为证明这一点,我们首先认识到 ResNEsts 是受基学习与直线预测中耦合问题限制的基函数模型。然后,为将预测权重与基学习解耦,我们构建了一种称为增广 ResNEst(A-ResNEst)的特殊架构,其总能保证增加块时性能不变差。因此,这样的 A-ResNEst 为使用相应基的 ResNEst 建立了经验风险下界。我们的结果表明 ResNEsts 确实存在特征复用递减的问题;然而,它可通过充分扩展或加宽输入空间来避免,从而带来上述理想性质。受已被证明优于 ResNets 的 DenseNets 启发,我们还提出了一种相应的新模型,称为稠密连接非线性估计器(DenseNEst)。我们证明任何 DenseNEst 都可表示为具有瓶颈块的宽 ResNEst。与 ResNEsts 不同,DenseNEsts 无需任何特殊架构重设计即可展现该理想性质。

关键词

引用

@article{arxiv.2111.05496,
  title  = {ResNEsts and DenseNEsts: Block-based DNN Models with Improved Representation Guarantees},
  author = {Kuan-Lin Chen and Ching-Hua Lee and Harinath Garudadri and Bhaskar D. Rao},
  journal= {arXiv preprint arXiv:2111.05496},
  year   = {2022}
}

备注

24 pages. Accepted by NeurIPS 2021. Remark 1 clarified and typos corrected