中文

基于多模态交叉量化器的无条件图像-文本对生成

计算机视觉与模式识别 2022-10-17 v2 机器学习

摘要

尽管深度生成模型已获得大量关注,现有工作大多针对单模态生成设计。本文探索一种用于无条件图像-文本对生成的新方法。我们设计了多模态交叉量化 VAE(MXQ-VAE),一种用于联合图像-文本表示的新型矢量量化器,并借此发现联合图像-文本表示空间对于语义一致的图像-文本对生成是有效的。为在量化空间中学习多模态语义关联,我们将 VQ-VAE 与 Transformer 编码器结合,并应用输入掩码策略。具体而言,MXQ-VAE 接受掩码后的图像-文本对作为输入,学习量化联合表示空间,从而将输入转换为统一码序列,随后我们利用该码序列进行无条件图像-文本对生成。大量实验展示了量化联合空间与多模态生成能力在合成及真实世界数据集上的相关性。此外,我们在这两个方面展示了该方法相对于若干基线的优越性。源代码公开于:https://github.com/ttumyche/MXQ-VAE。

关键词

引用

@article{arxiv.2204.07537,
  title  = {Unconditional Image-Text Pair Generation with Multimodal Cross Quantizer},
  author = {Hyungyung Lee and Sungjin Park and Joonseok Lee and Edward Choi},
  journal= {arXiv preprint arXiv:2204.07537},
  year   = {2022}
}

备注

BMVC 2022