面向多模态模因分类中多样化任务的视觉语言模型研究
计算与语言
2025-05-28 v1
摘要
在本文中,我们对视觉语言模型(VLMs)在不同模因分类任务中的表现进行了全面且系统的分析。我们提出了一种新方法,该方法生成基于 VLM 的模因图像理解,并在嵌入的模因文本的文本理解上对 LLMs 进行微调,以提高性能。我们的贡献有三方面:(1)针对每个子任务,采用多样化的提示策略对 VLMs 进行基准测试;(2)评估所有 VLM 组件上的 LoRA 微调,以评估性能提升;(3)提出一种新方法,利用 VLMs 生成的详细模因解释来训练较小的语言模型(LLMs),显著改善了分类效果。将 VLMs 与 LLMs 相结合的策略,在讽刺、冒犯性和情感分类上分别使基线性能提升了 8.34%、3.52% 和 26.24%。我们的结果揭示了 VLMs 的优势与局限性,并提出了一种新的模因理解策略。
引用
@article{arxiv.2505.20937,
title = {On VLMs for Diverse Tasks in Multimodal Meme Classification},
author = {Deepesh Gavit and Debajyoti Mazumder and Samiran Das and Jasabanta Patro},
journal= {arXiv preprint arXiv:2505.20937},
year = {2025}
}
备注
16 pages