GatedCLIP:用于仇恨表情检测的门控多模态融合
计算机视觉与模式识别
2026-02-25 v1
摘要
检测多模态表情中的仇恨内容 presents 独特的挑战,因为有害信息往往源于良性图像和文本之间复杂的相互作用。我们提出了 GatedCLIP,一种增强 CLIP 多模态能力的视觉语言模型,为仇恨表情检测引入了专门的架构改进。我们的ethods 引入了学习的投影头部,将 CLIP 嵌入映射到任务优化的语义空间,引入动态门控融合机制来自适应地加权视觉和文本特征,以及保持跨模态语义对齐的对比学习目标。在 Hateful Memes 数据集上进行的实验表明,GatedCLIP 达到了 0.66 的 AUROC,显著优于 CLIP 基线(AUROC 0.49),同时仅使用 35 万可训练参数保持了计算效率。
引用
@article{arxiv.2602.20818,
title = {GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection},
author = {Yingying Guo and Ke Zhang and Zirong Zeng},
journal= {arXiv preprint arXiv:2602.20818},
year = {2026}
}
备注
Preprint