中文

SoMeLVLM:面向社交媒体处理的大型视觉语言模型

计算与语言 2024-10-11 v1 多媒体

摘要

社交媒体的增长以其多模态特性为特征,导致了各种现象和挑战的出现,这需要一种有效的方法来统一解决自动化任务。强大的大型视觉语言模型使得同时处理多种任务成为可能,但即使采用精心设计的提示方法,通用领域模型往往难以与社交媒体任务的独特说话风格和上下文对齐。在本文中,我们介绍了一种面向社交媒体处理的大型视觉语言模型(SoMeLVLM),这是一个认知框架,具备五种关键能力:知识与理解、应用、分析、评估和创造。SoMeLVLM旨在理解和生成真实的社交媒体行为。我们开发了一个654k多模态社交媒体指令微调数据集,以支持我们的认知框架并微调模型。实验表明,SoMeLVLM在多个社交媒体任务中达到了最先进的性能。进一步的分析显示,其在认知能力方面相对于基线具有显著优势。

关键词

引用

@article{arxiv.2402.13022,
  title  = {SoMeLVLM: A Large Vision Language Model for Social Media Processing},
  author = {Xinnong Zhang and Haoyu Kuang and Xinyi Mou and Hanjia Lyu and Kun Wu and Siming Chen and Jiebo Luo and Xuanjing Huang and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2402.13022},
  year   = {2024}
}