面向仇恨表情检测的大型多模态模型稳健适配
计算与语言
2026-03-03 v4 人工智能
计算机视觉与模式识别
机器学习
摘要
仇恨表情在互联网上日益成为 a significant concern (重要关切), necessitates robust automated detection systems (鲁棒的自动化检测系统)。虽然大型多模态模型 (LMM) 在仇恨表情检测方面显示出前景,但面临着亚optimal performance (亚optimal 性能) 和 limited out-of-domain generalization capabilities (受限的跨域泛化能力) 等显著挑战。近期研究进一步揭示了在此设置下将监督微调 (SFT) 和 in-context learning 应用于 LMM 的局限性。为了解决这些问题,我们提出了一种用于仇恨表情检测的稳健适配框架,以增强 in-domain accuracy (领域内准确性) 和 cross-domain generalization (跨域泛化),同时保持 LMM 的通用视觉-语言能力。分析表明,我们的方法在对抗攻击下的鲁棒性优于 SFT 模型。在六个表情分类数据集上进行实验,表明我们的方法达到了 state-of-the-art performance (最佳性能),超越了更大型的 agentic systems (更大型的智能体系统)。此外,我们的方法生成的理由更高质量,用于解释仇恨内容,相对于标准 SFT,增强了模型的可解释性。代码可在 https://github.com/JingbiaoMei/RGCL 获取。
引用
@article{arxiv.2502.13061,
title = {Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection},
author = {Jingbiao Mei and Jinghong Chen and Guangyu Yang and Weizhe Lin and Bill Byrne},
journal= {arXiv preprint arXiv:2502.13061},
year = {2026}
}
备注
EMNLP 2025 Main (Oral)