通过学习具视觉语义码本增强视觉语言预训练
计算机视觉与模式识别
2022-08-02 v1
摘要
视觉语言预训练框架内的语言模态天然是离散的,赋予语言词汇中每个词一个语义。相比之下,视觉模态天然是连续且高维的,这可能阻碍视觉与语言模态间的对齐与融合。因此我们提出通过联合学习一个码本来“离散化”视觉表示,该码本赋予每个视觉 token 一个语义。我们随后利用这些离散化视觉语义作为自监督真值来构建我们的掩码图像建模目标,即掩码语言建模(已被证明对语言模型成功)的对应物。为优化码本,我们扩展了 VQ-VAE 的公式,其给出了理论保证。实验在常见视觉语言基准上验证了我们的方法的有效性。
引用
@article{arxiv.2208.00475,
title = {Augmenting Vision Language Pretraining by Learning Codebook with Visual Semantics},
author = {Xiaoyuan Guo and Jiali Duan and C. -C. Jay Kuo and Judy Wawira Gichoya and Imon Banerjee},
journal= {arXiv preprint arXiv:2208.00475},
year = {2022}
}
备注
7 pages, 4 figures, ICPR2022. arXiv admin note: text overlap with arXiv:2203.00048