中文

MultiClimate:气候变化视频的多模态立场检测

计算与语言 2024-09-30 v1 计算机视觉与模式识别

摘要

近年来,气候变化(CC)在自然语言处理领域引起了越来越多的关注。然而,在多模态数据中检测立场的研究尚不充分,且由于缺乏可靠数据集而具有挑战性。为了增进对公众舆论和传播策略的理解,本文介绍了MultiClimate,这是首个包含100个YouTube相关视频和4,209对帧-转录对的人工标注立场检测数据集。我们部署了最先进的视觉和语言模型,以及多模态模型用于MultiClimate立场检测。结果表明,仅文本的BERT显著优于仅图像的ResNet50和ViT。结合两种模态达到了最先进的性能,准确率/F1为0.747/0.749。我们100M大小的融合模型也超越了CLIP和BLIP,以及更大的9B大小的多模态IDEFICS和仅文本的Llama3和Gemma2,表明多模态立场检测对大型语言模型仍具挑战性。我们的代码、数据集以及补充材料可在https://github.com/werywjw/MultiClimate获取。

关键词

引用

@article{arxiv.2409.18346,
  title  = {MultiClimate: Multimodal Stance Detection on Climate Change Videos},
  author = {Jiawen Wang and Longfei Zuo and Siyao Peng and Barbara Plank},
  journal= {arXiv preprint arXiv:2409.18346},
  year   = {2024}
}

备注

5 pages, 1 figure