中文

上下文感知的多模态预训练

计算机视觉与模式识别 2024-11-25 v1 计算与语言 机器学习

摘要

大规模多模态表示学习成功地在测试时优化了零样图迁移。然而,标准的预训练范式(在大量图像-文本数据上的对比学习)并未明确鼓励表示支持少量样本的适应。在本工作中,我们提出了一种简单却精心设计的多模态预训练扩展,使表示能够容纳额外的上下文。使用这一目标,我们展示了视觉-语言模型可以在显著增加的few-shot适应方面进行训练:在21个下游任务上,我们发现测试时样本效率提升了最高可达4倍,平均few-shot适应收益超过5%,同时在不同模型规模和训练持续时间上保持零-shot泛化性能。特别是,配备简单、训练-free、基于指标的适应机制,我们的表示轻松超越了更复杂且计算密集的优化-based方案,大大简化了对新领域的泛化。

关键词

引用

@article{arxiv.2411.15099,
  title  = {Context-Aware Multimodal Pretraining},
  author = {Karsten Roth and Zeynep Akata and Dima Damen and Ivana Balažević and Olivier J. Hénaff},
  journal= {arXiv preprint arXiv:2411.15099},
  year   = {2024}
}