中文

探索基于大模型的社交媒体图像分类:关于文化自然对人类的贡献的案例研究

计算机视觉与模式识别 2025-05-21 v3 人工智能

摘要

社交媒体图像为建模、映射和理解人类与自然及文化遗产的互动提供了宝贵的见解。然而,将这些图像分类为具有语义意义的组仍然高度复杂,因为其视觉内容的广泛多样性和异质性,包含开放式的人类和自然元素。当类别涉及抽象概念且缺乏一致的视觉模式时,这一挑战更加突出。相关研究在分类过程中涉及人工监督,且缺乏公开基准数据集使得对这些工作的比较不可行。另一方面,大型模型(包括大型语言模型 LLM、大型视觉模型 LVM 和大型视觉语言模型 LVLVM)的持续进步为这一问题提供了大量未探索的解决方案。本文首先引入 FLIPS 数据集,包含 Flickr 图像,捕捉人类与自然相互作用的互动;其次评估了基于不同类型和组合的大型模型使用各种适应方法的各种解决方案。我们依据成本、生产力、可扩展性和结果质量对其进行评估,以解决社交媒体图像分类的挑战。

关键词

引用

@article{arxiv.2410.00275,
  title  = {Exploring Social Media Image Categorization Using Large Models with Different Adaptation Methods: A Case Study on Cultural Nature's Contributions to People},
  author = {Rohaifa Khaldi and Domingo Alcaraz-Segura and Ignacio Sánchez-Herrera and Javier Martinez-Lopez and Carlos Javier Navarro and Siham Tabik},
  journal= {arXiv preprint arXiv:2410.00275},
  year   = {2025}
}

备注

23 pages, 7 figures