中文

MM-Soc:社交媒体平台中多模态大语言模型的基准测试

计算与语言 2024-09-04 v3 计算机视觉与模式识别 计算机与社会

摘要

社交媒体平台是多模态信息交换的中心,涵盖文本、图像和视频,这使得机器难以理解与在线空间互动相关的信息或情感。多模态大语言模型(MLLMs)已成为解决这些挑战的有前景的解决方案,但它们在准确解读人类情感和复杂内容(如虚假信息)方面仍存在困难。本文介绍了 MM-Soc,这是一个旨在评估 MLLMs 对多模态社交媒体内容理解能力的综合基准。MM-Soc 汇编了著名的多模态数据集,并引入了一个新的大规模 YouTube 标签数据集,针对从虚假信息检测、仇恨言论检测到社会语境生成等一系列任务。通过对四种开源 MLLMs 的十个尺寸变体进行详尽评估,我们发现了显著的性能差异,突显了提升模型社会理解能力的必要性。我们的分析表明,在零样本设置下,各类 MLLMs 在处理社交媒体任务时普遍表现出困难。然而,MLLMs 在微调后表现出性能提升,这表明了潜在的改进途径。我们的代码和数据可在 https://github.com/claws-lab/MMSoc.git 获取。

关键词

引用

@article{arxiv.2402.14154,
  title  = {MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms},
  author = {Yiqiao Jin and Minje Choi and Gaurav Verma and Jindong Wang and Srijan Kumar},
  journal= {arXiv preprint arXiv:2402.14154},
  year   = {2024}
}

备注

In Proceedings of ACL 2024