多模态事件检测:当前方法与通过大语言模型和视觉语言模型定义新玩法
计算与语言
2025-05-19 v1 计算机视觉与模式识别
摘要
本文研究了在社交媒体上检测事件的挑战,其中传统单模态系统因数据传播的快速性和多模态性而难以应对。我们采用了包括 ModernBERT 和 ConvNeXt-V2 等单模态模型、多模态融合技术以及先进的生成模型如 GPT-4o 和 LLaVA。此外,我们还研究了为多模态生成模型(如 GPT-4o)提供单一模态以评估其效能。我们的结果表明,虽然多模态方法在性能上显著优于单模态方法,但尽管生成方法拥有大量参数,仍在精度上落后于监督方法。此外,我们发现生成方法在准确生成事件类别方面落后于指令微调模型。 During our error analysis, 我们发现常见的社交媒体问题如“leet speak”、文本拉伸等被生成方法有效处理,但使用监督方法难以应对。
引用
@article{arxiv.2505.10836,
title = {Multimodal Event Detection: Current Approaches and Defining the New Playground through LLMs and VLMs},
author = {Abhishek Dey and Aabha Bothera and Samhita Sarikonda and Rishav Aryan and Sanjay Kumar Podishetty and Akshay Havalgi and Gaurav Singh and Saurabh Srivastava},
journal= {arXiv preprint arXiv:2505.10836},
year = {2025}
}
备注
Accepted at NLDB 2025