HyperZ$\cdot$Z$\cdot$W 算子连接快慢网络以实现全上下文交互
计算机视觉与模式识别
2024-02-01 v1
摘要
自注意力机制利用大型隐式权重矩阵,通过基于点积的激活(具有极少的可训练参数)进行编程,以实现长序列建模。在本文中,我们探讨了通过采用大型隐式核在网络的每一层实现全上下文交互,从而摒弃残差学习的可能性。为实现这一目标,我们引入了基于坐标的隐式 MLP 作为慢速网络,为另一个快速卷积网络生成超核。为了获得用于快速动态编码的上下文变化权重,我们提出了一个 算子,该算子通过简单的逐元素乘法连接超核()和隐藏激活(),然后使用上下文相关的 对 进行卷积。基于此设计,我们提出了一种新颖的 Terminator 架构,该架构集成了不同大小的超核以产生多分支隐藏表示,从而增强每层的特征提取能力。此外,还采用了一个瓶颈层来压缩连接后的通道,仅允许有价值的信息传播到后续层。值得注意的是,我们的模型融合了多个创新组件,并展现出优异的特性,例如引入局部反馈误差来更新慢速网络、稳定的零均值特征、更快的训练收敛速度以及更少的模型参数。在像素级 1D 和 2D 图像分类基准上的大量实验结果表明了我们架构的卓越性能。
引用
@article{arxiv.2401.17948,
title = {HyperZ$\cdot$Z$\cdot$W Operator Connects Slow-Fast Networks for Full Context Interaction},
author = {Harvie Zhang},
journal= {arXiv preprint arXiv:2401.17948},
year = {2024}
}
备注
10 pages, 6 figures, 5 tables