中文

大型预训练模型的等变自适应

机器学习 2023-10-31 v2

摘要

等变网络被专门设计为确保对一组输入变换的一致行为,从而带来更高的样本效率以及更准确和鲁棒的预测。然而,将主流深度神经网络架构的每个组件重新设计以实现所选等变性是一个难题,并可能导致在训练和推理期间计算昂贵的网络。近期提出的一种去除架构约束以实现等变性的替代方案是使用简单的规范化(canonicalization)网络,在将输入送入无约束预测网络之前将其变换为规范形式。我们在此表明该方法可有效用于使大型预训练网络具有等变性。然而,我们观察到所产生的规范取向可能与训练分布的取向不对齐,从而阻碍性能。利用依赖于数据集的先验来指导规范化函数,我们能够使大型预训练模型具有等变性同时保持其性能。这显著提升了这些模型对数据确定性变换(如旋转)的鲁棒性。我们相信这种大型预训练模型的等变自适应可助力其在具有已知对称性先验的特定领域应用。

关键词

引用

@article{arxiv.2310.01647,
  title  = {Equivariant Adaptation of Large Pretrained Models},
  author = {Arnab Kumar Mondal and Siba Smarak Panigrahi and Sékou-Oumar Kaba and Sai Rajeswar and Siamak Ravanbakhsh},
  journal= {arXiv preprint arXiv:2310.01647},
  year   = {2023}
}

备注

17 pages, 6 figures. Accepted to NeurIPS 2023