中文

MemeGuard:基于LLM和VLM的内容审核框架通过梗图干预

计算与语言 2024-06-11 v1

摘要

在数字世界中,梗图(memes)因其潜在传播有害内容的特性,构成了内容审核的独特挑战。尽管检测方法不断进步,但主动解决方案如干预措施仍有限,现有研究主要关注文本内容,忽视了梗图这类多模态内容的广泛影响。为填补这一差距,我们提出了\textit{MemeGuard},一个综合性框架,利用大语言模型(LLM)和视觉语言模型(VLM)进行梗图干预。\textit{MemeGuard}利用专门微调的VLM,\textit{VLMeme}进行梗图解释,并采用多模态知识选择和排序机制(\textit{MKS})从中提炼相关知识。该知识随后由通用LLM用于生成情境上合适的干预措施。本 work 的另一关键贡献是\textit{\textbf{I}ntervening} \textit{\textbf{C}yberbullying in \textbf{M}ultimodal \textbf{M}emes(ICMM)}数据集,一个高质量、标记良好的数据集,包含有毒梗图及其对应的人类标注干预。我们利用\textit{ICMM}测试\textit{MemeGuard},证明其在生成针对有毒梗图的相关且有效响应方面具有优势。

关键词

引用

@article{arxiv.2406.05344,
  title  = {MemeGuard: An LLM and VLM-based Framework for Advancing Content Moderation via Meme Intervention},
  author = {Prince Jha and Raghav Jain and Konika Mandal and Aman Chadha and Sriparna Saha and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2406.05344},
  year   = {2024}
}