中文

面向多模态模因分类中多样化任务的视觉语言模型研究

计算与语言 2025-05-28 v1

摘要

在本文中,我们对视觉语言模型(VLMs)在不同模因分类任务中的表现进行了全面且系统的分析。我们提出了一种新方法,该方法生成基于 VLM 的模因图像理解,并在嵌入的模因文本的文本理解上对 LLMs 进行微调,以提高性能。我们的贡献有三方面:(1)针对每个子任务,采用多样化的提示策略对 VLMs 进行基准测试;(2)评估所有 VLM 组件上的 LoRA 微调,以评估性能提升;(3)提出一种新方法,利用 VLMs 生成的详细模因解释来训练较小的语言模型(LLMs),显著改善了分类效果。将 VLMs 与 LLMs 相结合的策略,在讽刺、冒犯性和情感分类上分别使基线性能提升了 8.34%、3.52% 和 26.24%。我们的结果揭示了 VLMs 的优势与局限性,并提出了一种新的模因理解策略。

关键词

引用

@article{arxiv.2505.20937,
  title  = {On VLMs for Diverse Tasks in Multimodal Meme Classification},
  author = {Deepesh Gavit and Debajyoti Mazumder and Samiran Das and Jasabanta Patro},
  journal= {arXiv preprint arXiv:2505.20937},
  year   = {2025}
}

备注

16 pages