中文

用单塔 Transformer 统一视觉-语言表示空间

机器学习 2022-11-22 v1 计算与语言 计算机视觉与模式识别

摘要

对比学习是一种距离学习形式,旨在从两个相关表示中学习不变特征。在本文中,我们探索了一个大胆的假设:一幅图像及其描述文本可以简单地视为底层互信息的两种不同视图,并训练一个模型以模态不可知的方式一次性编码两种模态,从而学习统一的视觉-语言表示空间。我们首先明确了学习用于视觉-语言预训练(VLP)的通用单塔模型的困难,并提出 OneR 作为一个简单而有效的框架来实现我们的目标。我们发现了区分 OneR 与先前学习模态特定表示空间的工作(如零样本目标定位、文本引导视觉推理和多模态检索)的有趣特性,并提供了分析以洞察这种新形式的多模态表示学习。充分的评估证明了统一模态不可知 VLP 框架的潜力。

关键词

引用

@article{arxiv.2211.11153,
  title  = {Unifying Vision-Language Representation Space with Single-tower Transformer},
  author = {Jiho Jang and Chaerin Kong and Donghyeon Jeon and Seonhoon Kim and Nojun Kwak},
  journal= {arXiv preprint arXiv:2211.11153},
  year   = {2022}
}

备注

AAAI 2023, 11 pages