FreeBind:通过知识融合实现统一多模态空间的免费午餐
计算机视觉与模式识别
2024-05-13 v2 人工智能
机器学习
摘要
统一的多模型表示空间是多模态理解和生成的基础。然而,数十亿模型参数和灾难性遗忘问题使得进一步提升预训练统一空间具有挑战。本文提出了 FreeBind 的一种想法,将多模态表示空间视为基本单元,通过集成来自额外专家空间的知识来自由地增强预训练统一空间。具体而言,我们引入两种基本空间键: 1) 空间位移键和 2) 空间组合键。基于这些基本键,我们设计了复杂的顺序与并行键,以有效地同时整合多个空间。得益于模块化概念,我们进一步提出了粗到细的定制推理策略,以灵活方式调整增强后的统一空间以满足不同需求。实验上,我们将 ImageBind 与额外的图像-文本和音频-文本专家空间绑定在一起, resulting in 三个主要变体: ImageBind++、InternVL_IB 和 InternVL_IB++。这些得到的空间在 9 个数据集上的 5 个音频-图像-文本下游任务中均优于 ImageBind。此外,通过定制推理,它甚至超过了先进的音频-文本和图像-文本专家空间。
引用
@article{arxiv.2405.04883,
title = {FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion},
author = {Zehan Wang and Ziang Zhang and Xize Cheng and Rongjie Huang and Luping Liu and Zhenhui Ye and Haifeng Huang and Yang Zhao and Tao Jin and Peng Gao and Zhou Zhao},
journal= {arXiv preprint arXiv:2405.04883},
year = {2024}
}
备注
Accepted by ICML 2024. The code and checkpoints will be released at https://github.com/zehanwang01/FreeBind