中文

UniBind:LLM增强的统一且均衡的表征空间,实现万物绑定

计算机视觉与模式识别 2024-03-20 v1

摘要

我们提出UniBind,一种灵活高效的方法,可为七种不同模态——图像、文本、音频、点云、热成像、视频和事件数据——学习统一的表征空间。现有工作(如ImageBind)将图像视为中心模态并构建以图像为中心的表征空间;然而,该空间可能并非最优,因为它导致所有模态间的表征空间不均衡。此外,类别名称被直接用于为下游任务提取文本嵌入,使得多模态数据的语义难以被表征。我们UniBind的“开箱即用”洞见在于使对齐中心与模态无关,并借助大型语言模型(LLMs)进一步学习统一且均衡的表征空间。UniBind的优越之处在于其可灵活应用于所有CLIP风格模型,并带来显著的性能提升。为实现这一点,我们:1)借助LLMs和多模态LLMs构建文本嵌入知识库;2)在知识库和编码后的视觉嵌入之上,自适应地构建LLM增强的类别级嵌入中心;3)通过对比学习将所有嵌入对齐到LLM增强的嵌入中心,以实现统一且均衡的表征空间。UniBind在零样本识别性能上平均比现有技术高出6.36%。最后,我们在多模态微调设置下取得了新的最优性能,例如在ImageNet上提升6.75%,同时减少了90%的可学习参数。

关键词

引用

@article{arxiv.2403.12532,
  title  = {UniBind: LLM-Augmented Unified and Balanced Representation Space to Bind Them All},
  author = {Yuanhuiyi Lyu and Xu Zheng and Jiazhou Zhou and Lin Wang},
  journal= {arXiv preprint arXiv:2403.12532},
  year   = {2024}
}

备注

Accepted to CVPR2024