中文

MemeCLIP:利用CLIP表示进行多模态梗图分类

机器学习 2024-10-29 v2 计算与语言 多媒体

摘要

文本嵌入图像的复杂性在机器学习中构成巨大挑战,因而需要对它们传达的多方面表达进行多模态理解。虽然之前的多模态分析研究主要聚焦于单一方面,如仇恨言论及其子类,但本研究将关注范围扩展到 linguistics 的多个方面:仇恨、仇恨对象、立场和幽默。我们引入了一个新型数据集 PrideMM,包含 5,063 个与 LGBTQ+ 亲爱运动相关的文本嵌入图像,从而填补了现有资源之间的严重空白。我们通过使用单模态和多模态基线方法对 PrideMM 上进行大规模实验,以为每个任务建立基准。此外,我们提出了一种新型框架 MemeCLIP,用于高效的下游学习,同时保留预训练 CLIP 模型的知识。我们的实验结果表明,MemeCLIP 在两个真实世界数据集上的性能优于以前提出的框架。我们进一步比较了 MemeCLIP 和零样本 GPT-4 在仇恨分类任务中的性能。最后,我们通过对误分类样本进行定性分析,讨论了模型的不足之处。我们的代码和数据集已公开提供:https://github.com/SiddhantBikram/MemeCLIP。

关键词

引用

@article{arxiv.2409.14703,
  title  = {MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification},
  author = {Siddhant Bikram Shah and Shuvam Shiwakoti and Maheep Chaudhary and Haohan Wang},
  journal= {arXiv preprint arXiv:2409.14703},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 (Main)