中文

从关联到生成:基于无监督跨模态映射的纯文本描述生成

计算机视觉与模式识别 2023-05-09 v3 计算与语言 机器学习

摘要

以 CLIP 和 ALIGN 为代表的视觉-语言预训练模型(VLPMs)借助 CLIP 无需微调的零样本能力,在图像分类和图文检索等基于关联的视觉任务上取得显著突破。然而,CLIP 难以应用于基于生成的任务。这是由于缺少用于生成的解码器架构与预训练任务。尽管已有工作通过附加语言模型为 CLIP 创造生成能力,但不同模态的 CLIP 表示间存在模态鸿沟,且 CLIP 无法建模该鸿沟的偏移,导致概念跨模态迁移失败。为解决此问题,我们试图将图像/视频映射到语言模态,并从语言模态生成描述。本文提出 K 近邻跨模态映射(Knight),一种从关联到生成的零样本方法。通过纯文本无监督训练,Knight 在图像描述与视频描述的零样本方法中达到最先进(State-of-the-Art)性能。我们的代码见 https://github.com/junyangwang0410/Knight。

关键词

引用

@article{arxiv.2304.13273,
  title  = {From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping},
  author = {Junyang Wang and Ming Yan and Yi Zhang and Jitao Sang},
  journal= {arXiv preprint arXiv:2304.13273},
  year   = {2023}
}

备注

11 pages, 15 figures, has been accepted by IJCAI 2023