中文

与 Symile 对比:面向无限模态的简单模型无关表征学习

机器学习 2024-11-05 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

对比学习方法(如 CLIP)利用自然配对的数据——例如图像及其对应的文本描述——来学习能够高效迁移到下游任务的通用表征。虽然此类方法通常应用于两种模态,但机器人、医疗和视频等领域需要同时支持多种类型的数据。我们证明,CLIP 的成对应用无法捕捉模态之间的联合信息,从而限制了所学表征的质量。为解决这一问题,我们提出了 Symile,一种简单的对比学习方法,能够捕捉任意数量模态之间的高阶信息。Symile 提供了一种灵活的、架构无关的目标函数,用于学习模态特定的表征。为开发 Symile 的目标函数,我们推导了全相关度的下界,并证明 Symile 表征对于任意模态集合构成预测剩余模态的充分统计量。Symile 在跨模态分类和检索方面优于成对 CLIP,即使在数据中存在缺失模态的情况下也是如此,实验涵盖一个原始的多语言数据集(包含 3300 万张图像、文本和音频样本)以及一个临床数据集(包含胸部 X 光、心电图和实验室测量)。本工作中使用的所有数据集和代码均公开发布于 https://github.com/rajesh-lab/symile。

关键词

引用

@article{arxiv.2411.01053,
  title  = {Contrasting with Symile: Simple Model-Agnostic Representation Learning for Unlimited Modalities},
  author = {Adriel Saporta and Aahlad Puli and Mark Goldstein and Rajesh Ranganath},
  journal= {arXiv preprint arXiv:2411.01053},
  year   = {2024}
}

备注

NeurIPS 2024