中文

基于噪声注入 CLIP 的纯文本训练图像描述生成

计算机视觉与模式识别 2023-10-13 v1 人工智能 机器学习

摘要

我们考虑在训练时仅使用 CLIP 模型和额外的文本数据、而不使用额外带描述图像的情况下进行图像描述生成的任务。我们的方法依赖于 CLIP 被训练为使视觉与文本嵌入相似这一事实。因此,我们只需学习如何将 CLIP 文本嵌入翻译回文本,并且可以通过仅使用文本为冻结的 CLIP 文本编码器学习一个解码器来学会这一点。我们认为这一直觉由于嵌入空间之间的差距而“几乎正确”,并提议通过在训练中注入噪声来纠正这一点。我们通过在四个基准(包括风格迁移)上展示 SOTA 的零样本图像描述生成来证实我们方法的有效性。代码、数据和模型已在 GitHub 上提供。

关键词

引用

@article{arxiv.2211.00575,
  title  = {Text-Only Training for Image Captioning using Noise-Injected CLIP},
  author = {David Nukrai and Ron Mokady and Amir Globerson},
  journal= {arXiv preprint arXiv:2211.00575},
  year   = {2023}
}

备注

Will be presented at EMNLP 2022. GitHub: https://github.com/DavidHuji/CapDec