基于预训练模型的高效等变迁移学习
机器学习
2023-10-12 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
高效的迁移学习算法是基础模型在多样化下游任务上即便数据有限也能取得成功的关键。Basu等人(2023)与Kaba等人(2022)的近期工作分别提出了对来自群变换输入的特徵进行群平均(equitune)以及基于优化的方法,以从非等变神经网络获得等变输出。虽然Kaba等人(2022)仅关注从头训练,我们发现equitune在等变零样本任务上表现不佳,尽管其微调结果良好。我们假设这是因为预训练模型对某些变换提供的特徵质量优于其他变换,而简单地对其平均是有害的。因此,我们提出λ-equitune,利用重要性权重λ对特徵进行平均。这些权重通过一个小型神经网络直接从数据中学得,带来了优于equitune的出色零样本与微调结果。进一步,我们证明λ-equitune是等变的且是等变函数的通用逼近器。此外,我们展示Kaba等人(2022)的方法配合适当的损失函数(我们称之为equizero)同样给出出色的零样本与微调性能。equitune与equizero均为λ-equitune的特例。为展示我们方法的简洁性与通用性,我们在广泛多样的的应用与模型上进行了验证,例如:1)使用CLIP的图像分类,2)深度Q学习,3)自然语言生成(NLG)中的公平性,4)语言中的组合泛化,以及5)使用Resnet与Alexnet等预训练CNN的图像分类。
引用
@article{arxiv.2305.09900,
title = {Efficient Equivariant Transfer Learning from Pretrained Models},
author = {Sourya Basu and Pulkit Katdare and Prasanna Sattigeri and Vijil Chenthamarakshan and Katherine Driggs-Campbell and Payel Das and Lav R. Varshney},
journal= {arXiv preprint arXiv:2305.09900},
year = {2023}
}