任务结构与非线性共同决定学习到的表征几何
机器学习
2024-01-25 v1
摘要
学习到的神经表征的效用取决于其几何结构能在多大程度上支持下游任务中的表现。这种几何结构取决于输入的结构、目标输出的结构以及网络架构。通过研究具有一个隐藏层的网络的学习动态,我们发现网络的激活函数对表征几何有着出乎意料的强烈影响:Tanh网络倾向于学习反映目标输出结构的表征,而ReLU网络则保留了更多关于原始输入结构的信息。在我们调节任务输入几何与任务标签几何之间对齐程度的一类广泛参数化任务中,这种差异被一致地观察到。我们分析了权重空间中的学习动态,并展示了具有Tanh和ReLU非线性的网络之间的差异如何源于ReLU的渐近不对称行为,这种行为促使特征神经元专门针对输入空间的不同区域。相比之下,Tanh网络中的特征神经元倾向于继承任务标签结构。因此,当目标输出为低维时,Tanh网络生成的神经表征比使用ReLU非线性获得的表征更加解耦。我们的发现揭示了神经网络中输入-输出几何、非线性与学习表征之间的相互作用。
引用
@article{arxiv.2401.13558,
title = {Task structure and nonlinearity jointly determine learned representational geometry},
author = {Matteo Alleman and Jack W Lindsey and Stefano Fusi},
journal= {arXiv preprint arXiv:2401.13558},
year = {2024}
}