Impression-CLIP:字体的对比形状-印象嵌入
计算机视觉与模式识别
2024-02-27 v1
摘要
字体给读者传达不同的印象。这些印象通常来自字体形状。然而,字体与其印象之间的相关性是微弱且不稳定的,因为印象是主观的。为了捕捉字体形状与其印象之间这种微弱且不稳定的跨模态相关性,我们提出了Impression-CLIP,一种基于CLIP(对比语言-图像预训练)的新型机器学习模型。通过使用基于CLIP的模型,字体图像特征及其印象特征被拉近,而字体图像特征与无关印象特征被推远。这个过程实现了字体图像与其印象之间的共同嵌入。在我们的实验中,我们通过共同嵌入进行字体与印象之间的跨模态检索。结果表明,Impression-CLIP比最先进的方法实现了更好的检索准确性。此外,我们的模型对噪声和缺失标签具有鲁棒性。
引用
@article{arxiv.2402.16350,
title = {Impression-CLIP: Contrastive Shape-Impression Embedding for Fonts},
author = {Yugo Kubota and Daichi Haraguchi and Seiichi Uchida},
journal= {arXiv preprint arXiv:2402.16350},
year = {2024}
}