中文

单GPU上的数据高效多模态融合

机器学习 2024-04-11 v4 人工智能 计算机视觉与模式识别

摘要

多模态对齐的目标是学习一个在多模态输入之间共享的单一潜在空间。该领域最强大的模型是通过使用大规模配对输入数据集和大规模计算资源训练的,这使得它们在许多实际场景中训练成本过高。我们推测,现有在大规模单模态数据上预训练的单模态编码器应该能够提供有效的引导,以更低的成本从单模态模型创建多模态模型。因此,我们提出了FuseMix,一种在任意预训练单模态编码器的潜在空间上运行的多模态增强方案。使用FuseMix进行多模态对齐,我们在图像-文本和音频-文本检索中取得了有竞争力的性能——在某些情况下甚至超越了最先进的方法——而计算和数据量却少了几个数量级:例如,我们在Flickr30K文本到图像检索任务上超越了CLIP,使用的GPU天数减少了约600倍,图像-文本对减少了约80倍。此外,我们展示了如何将我们的方法应用于将预训练的文本到图像生成模型转换为音频到图像模型。代码可在:https://github.com/layer6ai-labs/fusemix。

关键词

引用

@article{arxiv.2312.10144,
  title  = {Data-Efficient Multimodal Fusion on a Single GPU},
  author = {Noël Vouitsis and Zhaoyan Liu and Satya Krishna Gorti and Valentin Villecroze and Jesse C. Cresswell and Guangwei Yu and Gabriel Loaiza-Ganem and Maksims Volkovs},
  journal= {arXiv preprint arXiv:2312.10144},
  year   = {2024}
}

备注

CVPR 2024 (Highlight)