中文

从密码本到视觉语言模型:社交媒体气候变化自动化视觉话语分析评估

计算机视觉与模式识别 2026-04-24 v1

摘要

社交媒体平台已成为气候沟通的主要场域,生成数百万图片和帖子——如果系统性地分析,这些图片和帖子可以揭示哪些沟通策略能激发公众关注,哪些则徒劳无功。我们旨在通过分析计算机视觉方法如何用于社交媒体话语分析来促进此类研究。该分析包括应用基础分类设计、模型选择、提示工程和验证。我们对六个可提示视觉语言模型和十五个零样本CLIP类模型在X(前身为Twitter)上的两个数据集进行基准测试——一个包含1,038张经专家标注的图片,以及一个规模更大的语料库,包含超过120万张图片,50,000个标签经过人工验证,涵盖五个标注维度:动物内容、气候变化后果、气候行动、图片场景和图片类型。在所评估的模型中,Gemini-3.1-flash-lite 在所有超级类别和两个数据集上均超过所有其他模型,而中等规模的开源模型与其之间的差距相对较小。除了实例级指标之外,我们主张进行分布式评估:即使单张图片的准确率适中,VLM的预测也可可靠地恢复人群水平趋势,这使得它们在大规模话语分析中成为可行的起点。我们发现,链式思考推理反而会降低性能,而特定标注维度的提示设计则能提升性能。我们在https://github.com/KathPra/Codebooks2VLMs.git上发布了推文ID、标签以及我们的代码。

关键词

引用

@article{arxiv.2604.21786,
  title  = {From Codebooks to VLMs: Evaluating Automated Visual Discourse Analysis for Climate Change on Social Media},
  author = {Katharina Prasse and Steffen Jung and Isaac Bravo and Stefanie Walter and Patrick Knab and Christian Bartelt and Margret Keuper},
  journal= {arXiv preprint arXiv:2604.21786},
  year   = {2026}
}