用于知识 grounding 数据标注的大型视觉语言模型
机器学习
2025-01-24 v1
摘要
梗图(memes)作为一种将视觉与文本元素融合以传递幽默、讽刺及文化信息的强大表达形式,日益受到关注。现有研究主要关注情感分类、梗图生成、传播、解读、修辞语言及社会语言学等方面,但往往忽略了梗图的深层理解与梗图文本检索。为此,本文引入ClassicMemes-50-templates(CM50),一个由超过 33,000 张梗图构成的大规模数据集,聚焦50个流行梗图模板。我们还提出一种自动化的知识 grounding 标注管道,利用大型视觉语言模型生成高质量的图像标题、梗图标题及修辞技能标签,克服了人工标注的高昂成本。此外,我们提出一种梗图文本检索 CLIP 模型(mtrCLIP),利用跨模态嵌入提升梗图分析效果,显著改善检索性能。我们的贡献包括:(1) 一个用于大规模梗图研究的新型数据集,(2) 一个可扩展的梗图标注框架,以及(3)一个针对梗图文本检索的微调 CLIP 模型,旨在推动梗图在规模化理解与分析方面的发展。
引用
@article{arxiv.2501.13851,
title = {Large Vision-Language Models for Knowledge-Grounded Data Annotation of Memes},
author = {Shiling Deng and Serge Belongie and Peter Ebert Christensen},
journal= {arXiv preprint arXiv:2501.13851},
year = {2025}
}
备注
18 pages, 5 figures, 13 tables, GitHub repository: https://github.com/Seefreem/meme_text_retrieval_p1