APE:对齐预训练编码器以快速学习对齐的多模态表示
机器学习
2022-10-11 v1
摘要
近期在对齐多模态表示学习方面的进展主要由在大规模噪声配对模态数据集上训练大型神经网络所驱动。在本工作中,我们探究是否可能以显著更少的训练时间与数据实现类似结果。我们通过利用现有的预训练单模态编码器以及针对感兴趣下游任务精心筛选的对齐数据来实现这一点。我们研究一种通过小型辅助函数对齐现有编码器的自然方法,并发现该方法在许多设定下可与最先进水平竞争(或超越),同时更不易过拟合、训练成本更低且对分布偏移更鲁棒。借助恰当选择的对齐分布,我们的方法在使用少两个数量级的时间与数据且少训练 77% 参数的情况下,于公开数据上超越了 ImageNet 零样本分类的先前最先进水平。
引用
@article{arxiv.2210.03927,
title = {APE: Aligning Pretrained Encoders to Quickly Learn Aligned Multimodal Representations},
author = {Elan Rosenfeld and Preetum Nakkiran and Hadi Pouransari and Oncel Tuzel and Fartash Faghri},
journal= {arXiv preprint arXiv:2210.03927},
year = {2022}
}