揭示神经网络中的特征提取机制
计算与语言
2023-10-27 v2
摘要
神经网络捕获精确知识的底层机制一直是持续研究的课题。本工作中,我们提出一种基于神经切线核(NTKs)的理论方法来研究此类机制。具体而言,考虑无限网络宽度,我们假设目标模型的学习动态可直观地揭示其从训练数据中获取的特征,从而深化对其内部机制的理解。我们将该方法应用于若干基础模型,揭示了这些模型如何在梯度下降中利用统计特征以及如何将其整合进最终决策。我们还发现激活函数的选择会影响特征提取。例如,使用 ReLU 激活函数可能引入特征偏置,这为近期预训练语言模型中以其他函数替代 ReLU 提供了合理解释。此外,我们发现尽管自注意力与 CNN 模型在学习 n-gram 方面可能存在局限,基于乘法的模型似乎在此方面表现优异。我们通过实验验证了这些理论发现,并发现它们可应用于分析语言建模任务,后者可视为分类的一种特殊变体。我们的贡献增进了对大语言模型中基础组件作用与能力的理解,从而有助于更广泛地理解这些复杂系统。
引用
@article{arxiv.2310.16350,
title = {Unraveling Feature Extraction Mechanisms in Neural Networks},
author = {Xiaobing Sun and Jiaxi Li and Wei Lu},
journal= {arXiv preprint arXiv:2310.16350},
year = {2023}
}
备注
Accepted by EMNLP 2023