基于噪声注入 CLIP 的纯文本训练图像描述生成
计算机视觉与模式识别
2023-10-13 v1 人工智能
机器学习
摘要
我们考虑在训练时仅使用 CLIP 模型和额外的文本数据、而不使用额外带描述图像的情况下进行图像描述生成的任务。我们的方法依赖于 CLIP 被训练为使视觉与文本嵌入相似这一事实。因此,我们只需学习如何将 CLIP 文本嵌入翻译回文本,并且可以通过仅使用文本为冻结的 CLIP 文本编码器学习一个解码器来学会这一点。我们认为这一直觉由于嵌入空间之间的差距而“几乎正确”,并提议通过在训练中注入噪声来纠正这一点。我们通过在四个基准(包括风格迁移)上展示 SOTA 的零样本图像描述生成来证实我们方法的有效性。代码、数据和模型已在 GitHub 上提供。
引用
@article{arxiv.2211.00575,
title = {Text-Only Training for Image Captioning using Noise-Injected CLIP},
author = {David Nukrai and Ron Mokady and Amir Globerson},
journal= {arXiv preprint arXiv:2211.00575},
year = {2023}
}
备注
Will be presented at EMNLP 2022. GitHub: https://github.com/DavidHuji/CapDec