中文

自注意力层的拟态初始化

计算机视觉与模式识别 2023-05-18 v1 人工智能 机器学习 机器学习

摘要

在小数据集上训练Transformer notoriously 困难;通常转而使用大型预训练模型作为起点。我们探究此类预训练Transformer(尤其是视觉领域)的权重,试图找出造成这一差异的原因。令人惊讶的是,我们发现仅将自注意力层权重初始化为使其“看起来”更像其预训练对应物,就能让我们更快训练原始Transformer并达到更高的最终准确率,特别是在CIFAR-10和ImageNet分类等视觉任务上,我们分别观察到超过5%和4%的准确率提升。我们的初始化方案是闭式、无学习且非常简单的:我们将查询与键权重的乘积设为近似单位阵,并将值与投影权重的乘积设为近似负单位阵。由于这模仿了我们在预训练Transformer中看到的模式,我们称该技术为“拟态初始化”(mimetic initialization)。

关键词

引用

@article{arxiv.2305.09828,
  title  = {Mimetic Initialization of Self-Attention Layers},
  author = {Asher Trockman and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2305.09828},
  year   = {2023}
}