中文

基于适配器状态共享的CLIP模型用于参数高效多模态讽刺检测

计算与语言 2025-10-30 v2

摘要

社交媒体上多模态图像-文本讽刺内容的日益普及给意见挖掘系统带来了挑战。现有方法依赖于对大型模型的完全微调,使其难以适应资源受限的环境。虽然最近的参数高效微调(PEFT)方法提供了希望,但它们在讽刺检测等复杂任务上的现成使用表现不佳。我们提出了AdS-CLIP(CLIP中的适配器状态共享),这是一个基于CLIP的轻量级框架,它仅在网络上层插入适配器以保留下层的低级单模态表示,并引入了一种新颖的适配器状态共享机制,其中文本适配器引导视觉适配器,以促进上层高效的跨模态学习。在两个公开基准上的实验表明,AdS-CLIP不仅优于标准的PEFT方法,而且以显著更少的可训练参数超越了现有的多模态基线方法。

关键词

引用

@article{arxiv.2507.04508,
  title  = {Adapter-state Sharing CLIP for Parameter-efficient Multimodal Sarcasm Detection},
  author = {Soumyadeep Jana and Sahil Danayak and Sanasam Ranbir Singh},
  journal= {arXiv preprint arXiv:2507.04508},
  year   = {2025}
}