中文

视觉语言模型在视觉情感分析中的应用研究:以 CLIP 为例

计算机视觉与模式识别 2023-10-19 v1

摘要

本工作研究了如何利用 CLIP 的嵌入空间来执行视觉情感分析。我们基于 CLIP 嵌入空间(记为 CLIP-E)构建了两种架构并进行实验。我们使用 WEBEmo(最大的公开可用且人工标注的视觉情感分析基准)训练 CLIP-E 模型,并进行了两组实验。首先,我们在 WEBEmo 上进行测试,将 CLIP-E 架构与最先进(SOTA)模型以及 CLIP Zero-Shot 进行比较。其次,我们进行跨数据集评估,将在 WEBEmo 上训练的 CLIP-E 架构应用于其他视觉情感分析基准进行测试。我们的结果表明,CLIP-E 方法在 WEBEmo 细粒度分类上优于 SOTA 模型,并且在未见过的数据集上测试时泛化能力更好。有趣的是,我们观察到在 FI 数据集上,CLIP Zero-Shot 的准确率高于 SOTA 模型和基于 WEBEmo 训练的 CLIP-E。这些结果引发了我们在本文中讨论的若干问题,例如我们应如何设计新的基准并评估视觉情感分析,以及我们是否应继续为视觉情感分析设计定制化的深度学习模型,还是应将精力集中在更好地利用 CLIP 等大型视觉语言模型中编码的知识来完成该任务。

关键词

引用

@article{arxiv.2310.12062,
  title  = {On the use of Vision-Language models for Visual Sentiment Analysis: a study on CLIP},
  author = {Cristina Bustos and Carles Civit and Brian Du and Albert Sole-Ribalta and Agata Lapedriza},
  journal= {arXiv preprint arXiv:2310.12062},
  year   = {2023}
}