ClimateVID——社交媒体视频分析及其挑战
计算机视觉与模式识别
2026-05-01 v1
摘要
数字内容的普遍增长,特别是社交媒体平台上的短视频,已显著改变了公共话语中讨论和理解话题的方式。在这项工作中,我们通过评估社交媒体数据上的零样本和聚类能力来推进自动化视觉主题检测。(1)我们使用零样本图像分类评估了 VideoChatGPT、PandaGPT 和 VideoLLava 等知名视觉语言模型(VLM)的能力,并将其性能与基于逐帧 CLIP 图像分类的基线进行了比较。(2)通过将聚类视为最小代价多割问题,我们旨在以无监督的方式揭示有洞察力的模式。对于这两种分析策略,我们提供了广泛的评估和面向实践者的实用指导。虽然视觉语言模型目前无法检测气候变化特定类别,但聚类结果呈现出独特的视觉帧。我们发现 ConvNeXt V2 和 DINOv2 都能产生有意义的聚类,其中 DINOv2 更侧重于风格差异和抽象类别,而 ConvNeXt V2 的聚类在更细粒度的方面有所不同。代码可在 https://github.com/KathPra/ClimateVID.git 获取。
引用
@article{arxiv.2604.27968,
title = {ClimateVID -- Social Media Videos Analysis and Challenges Involved},
author = {Shiqi Xu and Moritz Burmester and Katharina Prasse and Isaac Bravo and Stefanie Walter and Margret Keuper},
journal= {arXiv preprint arXiv:2604.27968},
year = {2026}
}
备注
Equal contributions by Shiqi Xu and Moritz Burmester