双曲图像-文本表示
计算机视觉与模式识别
2024-01-19 v3 机器学习
摘要
视觉与语言概念自然地在层级中组织自身,其中文本概念“狗”蕴含所有包含狗的图像。尽管直观,当前大规模视觉与语言模型如 CLIP 并未显式捕捉此类层级。我们提出 MERU,一种产生图像与文本双曲表示的对比模型。双曲空间具有嵌入树状数据的合适几何性质,因此 MERU 能更好地捕捉图像-文本数据集中的底层层级。我们的结果表明,MERU 学习到高度可解释且结构化的表示空间,同时在标准多模态任务(如图像分类与图像-文本检索)上与 CLIP 的性能具有竞争力。我们的代码与模型可在 https://www.github.com/facebookresearch/meru 获取。
引用
@article{arxiv.2304.09172,
title = {Hyperbolic Image-Text Representations},
author = {Karan Desai and Maximilian Nickel and Tanmay Rajpurohit and Justin Johnson and Ramakrishna Vedantam},
journal= {arXiv preprint arXiv:2304.09172},
year = {2024}
}
备注
ICML 2023 (v3: Add link to code in abstract)