中文

思考模型能否思考来检测仇恨表情包?

计算与语言 2026-03-03 v1

摘要

仇恨表情包往往需要组合式多模态推理:图像和文本在单独观察时可能看起来无害,但其相互作用传递出有害意图。虽然基于思考的多模态大语言模型(Multimodal large language model, MLLM)最近在视觉语言理解方面取得了进展,但其能力在仇恨表情包分析方面仍未得到充分探索。我们提出了一种基于强化学习的后训练框架,通过任务特定奖励和新颖的群体相对策略优化(Group Relative Policy Optimization, GRPO)目标来提高思考式MLLM的推理能力。具体而言,我们(i)系统性地研究了即插即用MLLM用于仇恨表情包理解;(ii)通过蒸馏生成弱或伪监督的链式思考(chain-of-thought)理由,扩展了现有的仇恨表情包数据集;(iii)引入基于GRPO的目标,联合优化表情包分类和解释质量,以鼓励细粒度、逐步推理。在Hateful Memes基准测试上进行实验,我们的方法实现了最先进的性能,在准确率和F1分数上分别提高约1个百分点,在解释质量上提高约3个百分点。我们将公开发布代码、数据集扩展和评估资源,以支持可重复性。

关键词

引用

@article{arxiv.2603.01225,
  title  = {Can Thinking Models Think to Detect Hateful Memes?},
  author = {Mohamed Bayan Kmainasi and Mucahid Kutlu and Ali Ezzat Shahroor and Abul Hasnat and Firoj Alam},
  journal= {arXiv preprint arXiv:2603.01225},
  year   = {2026}
}