看见、解释与干预:面向仇恨模因审核的少样本多模态智能体框架
计算与语言
2026-01-09 v1 计算机视觉与模式识别
摘要
在本工作中,我们通过应用一系列基于生成式 AI 模型构建的策略,从三个互补的角度审视仇恨模因——如何检测它们、如何解释其内容,以及如何在它们发布前进行干预。据我们所知,解释和干预通常与检测分开研究,这不符合现实世界的实际情况。此外,由于为模因审核策划大规模标注数据集的成本过高,我们提出了一种新颖的框架,该框架利用特定任务的生成式多模态智能体和大型多模态模型的少样本适应能力,以迎合不同类型的模因。我们相信这是第一项专注于在有限数据条件下实现可泛化仇恨模因审核的工作,在实际生产场景中具有强大的部署潜力。警告:包含潜在的有毒内容。
引用
@article{arxiv.2601.04692,
title = {See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation},
author = {Naquee Rizwan and Subhankar Swain and Paramananda Bhaskar and Gagan Aryan and Shehryaar Shah Khan and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2601.04692},
year = {2026}
}