跨模态微调:先对齐再精炼
机器学习
2023-03-21 v2
摘要
微调大规模预训练模型在视觉和自然语言处理等研究充分的模态中取得了巨大进展。然而,由于缺少相关的预训练模型,在许多其他模态中尚未观察到类似的收益。本文提出 ORCA,一个通用的跨模态微调框架,将单一大规模预训练模型的适用性扩展到多种模态。ORCA 通过“先对齐再精炼”的工作流适应目标任务:给定目标输入,ORCA 首先学习一个嵌入网络,将嵌入的特征分布与预训练模态对齐。随后在该嵌入数据上微调预训练模型,以利用跨模态共享的知识。通过大量实验,我们表明 ORCA 在包含来自 12 种模态的 60 多个数据集的 3 个基准上取得了最先进的结果,优于广泛的手动设计、AutoML、通用以及任务专用方法。我们通过一系列消融研究强调了数据对齐的重要性,并展示了 ORCA 在数据有限场景下的效用。
引用
@article{arxiv.2302.05738,
title = {Cross-Modal Fine-Tuning: Align then Refine},
author = {Junhong Shen and Liam Li and Lucio M. Dery and Corey Staten and Mikhail Khodak and Graham Neubig and Ameet Talwalkar},
journal= {arXiv preprint arXiv:2302.05738},
year = {2023}
}