中文

MultiCapCLIP:用于零样本多语言视觉描述的提示自编码方法

计算机视觉与模式识别 2023-08-28 v1 人工智能

摘要

有监督视觉描述模型通常需要大规模图像或视频与特定语言描述(即视觉-描述对)配对用于训练。然而,对许多场景与语言而言,收集与标注大规模数据集耗时且昂贵。因此,充足的标注配对通常难以获取。为应对标注短缺问题,我们提出一种简洁而有效的零样本方法 MultiCapCLIP,其可在无任何下游数据集标注视觉-描述对的情况下,为不同场景与语言生成视觉描述。训练阶段,MultiCapCLIP 仅需文本数据作为输入,随后执行两个主要步骤:1)检索保留新场景相应领域知识的概念提示;2)对提示进行自编码以学习书写风格,输出所需语言的描述。测试阶段,MultiCapCLIP 直接以视觉数据作为输入检索概念提示,生成最终视觉描述。在四个基准与四种语言(即英语、中文、德语和法语)上的图像与视频描述大量实验验证了方法的有效性。相较最先进的零样本与弱监督方法,我们的方法在 BLEU@4 与 CIDEr 指标上分别取得 4.8% 与 21.5% 的绝对提升。代码见 https://github.com/yangbang18/MultiCapCLIP。

关键词

引用

@article{arxiv.2308.13218,
  title  = {MultiCapCLIP: Auto-Encoding Prompts for Zero-Shot Multilingual Visual Captioning},
  author = {Bang Yang and Fenglin Liu and Xian Wu and Yaowei Wang and Xu Sun and Yuexian Zou},
  journal= {arXiv preprint arXiv:2308.13218},
  year   = {2023}
}

备注

ACL'2023, 13 pages, 4 figures