GPT-4V(ision) 作为社交媒体分析引擎
计算机视觉与模式识别
2023-11-14 v1 人工智能
计算与语言
多媒体
摘要
近期研究揭示了大型多模态模型(LMMs)在各种通用视觉与语言任务中的非凡能力。人们对于 LMMs 在更专业领域中的表现日益关注。社交媒体内容本质上是多模态的,融合了文本、图像、视频,有时还有音频。理解社交多媒体内容对当代机器学习框架而言仍是一个具有挑战性的问题。在本文中,我们探索 GPT-4V(ision) 在社交多媒体分析方面的能力。我们选取了五个代表性任务,包括情感分析、仇恨言论检测、假新闻识别、人口统计推断和政治意识形态检测,以评估 GPT-4V。我们的研究首先使用现有基准数据集对每个任务进行初步的定量分析,随后仔细审视结果并挑选定性样本以阐明 GPT-4V 在理解多模态社交媒体内容方面的潜力。GPT-4V 在这些任务中展现出卓越效能,显示出诸如图像-文本对的联合理解、上下文与文化意识以及广泛常识知识等优势。尽管 GPT-4V 在社交媒体领域的整体能力令人印象深刻,仍存在显著挑战。GPT-4V 在涉及多语言社交多媒体理解的任务中表现吃力,且难以推广到社交媒体中的最新趋势。此外,它倾向于在演化中的名人和政治家知识背景下生成错误信息,反映了已知的幻觉问题。我们从发现中获得的见解强调了 LMMs 通过分析多模态信息来增强我们对社交媒体内容及其用户理解的美好前景。
引用
@article{arxiv.2311.07547,
title = {GPT-4V(ision) as A Social Media Analysis Engine},
author = {Hanjia Lyu and Jinfa Huang and Daoan Zhang and Yongsheng Yu and Xinyi Mou and Jinsheng Pan and Zhengyuan Yang and Zhongyu Wei and Jiebo Luo},
journal= {arXiv preprint arXiv:2311.07547},
year = {2023}
}