基于Top-k邻居的CLIP模型用于图像到文本提示生成
计算机视觉与模式识别
2024-01-19 v1 人工智能
摘要
文本到图像合成是多模态生成的一个子领域,近年来受到了广泛关注。我们提出了一种经济高效的图像到提示生成方法,该方法利用生成模型生成文本提示,无需大量标注数据。我们将方法分为两个阶段:在线阶段和离线阶段。我们结合使用了CLIP模型和K近邻(KNN)算法。所提出的系统由两部分组成:离线任务和在线任务。我们的方法在这些模型中取得了最高指标0.612,分别比Clip、Clip+KNN(top 10)高出0.013、0.055、0.011。
引用
@article{arxiv.2401.09763,
title = {CLIP Model for Images to Textual Prompts Based on Top-k Neighbors},
author = {Xin Zhang and Xin Zhang and YeMing Cai and Tianzhi Jia},
journal= {arXiv preprint arXiv:2401.09763},
year = {2024}
}
备注
CLIP model, KNN, image-to-prompts