重新审视对比学习中的多模态表示:从块与词元嵌入到有限离散词元
计算机视觉与模式识别
2023-03-28 v1
摘要
基于对比学习的视觉-语言预训练方法(如 CLIP)已在许多视觉-语言任务中展现出巨大成功。这些方法通过对匹配的图像-文本对进行编码以生成相似的特征嵌入来实现跨模态对齐,这些嵌入由聚合视觉块与语言词元的信息得到。然而,由于视觉块与文本词元在语义层次与粒度上不同,直接使用此类表示对齐跨模态信息具有挑战性。为缓解该问题,我们提出了一种基于有限离散词元(FDT)的多模态表示。FDT 是一组表示特定视觉-语义概念的可学习词元。图像与文本均通过共享的 FDT 进行嵌入:首先将多模态输入定位到 FDT 空间,然后聚合被激活的 FDT 表示。通过稀疏激活约束,迫使匹配的视觉与语义概念由同一组离散词元表示。由此,两种模态间的粒度差距得以缩小。通过定量与定性分析,我们证明在 CLIP 风格模型中使用 FDT 表示可改善跨模态对齐,并提升视觉识别与视觉-语言下游任务中的性能。此外,我们表明所提方法能学习更全面的表示,且学到的 FDT 捕捉了从物体到动作与属性的有意义跨模态对应。
引用
@article{arxiv.2303.14865,
title = {Revisiting Multimodal Representation in Contrastive Learning: From Patch and Token Embeddings to Finite Discrete Tokens},
author = {Yuxiao Chen and Jianbo Yuan and Yu Tian and Shijie Geng and Xinyu Li and Ding Zhou and Dimitris N. Metaxas and Hongxia Yang},
journal= {arXiv preprint arXiv:2303.14865},
year = {2023}
}
备注
Accepted to CVPR 2023