中文

基于 CLIP 的风格歧义损失

计算机视觉与模式识别 2025-08-19 v3

摘要

本文探讨了将原本用于逼近创造性的风格歧义训练目标应用于扩散模型的方法。然而,该目标需要预训练分类器和标记数据集。我们引入新的风格歧义损失形式,无需训练新分类器或标记数据集。不同于使用分类器,我们在 CLIP 嵌入空间中生成质心,并根据图像到这些质心的相对距离进行分类。我们通过无标签数据集的 K 均值聚类,以及使用文本标签生成 CLIP 嵌入作为质心来获得这些质心。代码已公开于 https://github.com/jamesBaker361/clipcreate

关键词

引用

@article{arxiv.2410.02055,
  title  = {Style Ambiguity Loss Using CLIP},
  author = {James Baker},
  journal= {arXiv preprint arXiv:2410.02055},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2407.12009