中文

连接、坍缩、破坏:利用单模态数据学习跨模态任务

机器学习 2024-01-17 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

由于有限的配对多模态数据,构建跨模态应用具有挑战性。最近的研究表明,利用预训练的多模态对比表示空间可以从单模态数据中学习跨模态任务。这基于一个假设:对比优化使得不同模态的嵌入可互换。然而,由于多模态对比空间的几何结构(存在模态差距)尚未被充分理解,这一假设的探索不足。在我们的研究中,我们对该空间的几何结构提供了理论解释,并引入了一种三步方法C3C^3(连接、坍缩、破坏)来弥合模态差距,增强嵌入的可互换性。我们的C3C^3方法显著改善了从单模态数据进行的跨模态学习,在零样本图像/音频/视频描述生成和文本到图像生成任务上取得了最先进的结果。

关键词

引用

@article{arxiv.2401.08567,
  title  = {Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data},
  author = {Yuhui Zhang and Elaine Sui and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2401.08567},
  year   = {2024}
}

备注

Published at ICLR 2024