从关联到生成:基于无监督跨模态映射的纯文本描述生成
计算机视觉与模式识别
2023-05-09 v3 计算与语言
机器学习
摘要
以 CLIP 和 ALIGN 为代表的视觉-语言预训练模型(VLPMs)借助 CLIP 无需微调的零样本能力,在图像分类和图文检索等基于关联的视觉任务上取得显著突破。然而,CLIP 难以应用于基于生成的任务。这是由于缺少用于生成的解码器架构与预训练任务。尽管已有工作通过附加语言模型为 CLIP 创造生成能力,但不同模态的 CLIP 表示间存在模态鸿沟,且 CLIP 无法建模该鸿沟的偏移,导致概念跨模态迁移失败。为解决此问题,我们试图将图像/视频映射到语言模态,并从语言模态生成描述。本文提出 K 近邻跨模态映射(Knight),一种从关联到生成的零样本方法。通过纯文本无监督训练,Knight 在图像描述与视频描述的零样本方法中达到最先进(State-of-the-Art)性能。我们的代码见 https://github.com/junyangwang0410/Knight。
引用
@article{arxiv.2304.13273,
title = {From Association to Generation: Text-only Captioning by Unsupervised Cross-modal Mapping},
author = {Junyang Wang and Ming Yan and Yi Zhang and Jitao Sang},
journal= {arXiv preprint arXiv:2304.13273},
year = {2023}
}
备注
11 pages, 15 figures, has been accepted by IJCAI 2023