ExPO-HM:用于仇恨表情检测的解释-检测学习方法
计算与语言
2026-03-03 v3
摘要
仇恨表情(hateful memes)作为一种尤其具有挑战性的线上滥用形式,推动了自动化检测系统的开发。大多数先前方法依赖直接检测,仅产生二元预测。此类模型未能提供实际Moderation所需的上下文和解释。近期的解释-检测方法(如链式思维提示或大型语言模型代理)在与简单SFT基线相比表现更差,即使是先进的后训练方法(如GRPO)也未能缩小差距。我们的分析识别出此类系统的两个关键问题:重要的政策相关线索(如目标和攻击类型)未被模型作为可能的解释假设;二元奖励信号不足以引导推理。为此,我们提出ExPO-HM(仇恨表情检测的解释-检测策略优化),灵感来自人类标注者的训练和评估过程。ExPO-HM结合了SFT热身、GRPO的课程学习,以及条件决策熵(CDE)作为推理质量的度量和奖励。我们在三个仇恨表情基准数据集上测试,ExPO-HM在二元检测、细粒度分类和推理质量方面均实现了最先进的性能,相较于GRPO和DPO基线分别实现了最高15%和17%的F1分数提升。通过将仇恨表情检测从简单的二元报警转向解释驱动的检测,ExPO-HM提供了准确、可解释且可操作的Moderation支持。代码已公开于https://github.com/JingbiaoMei/ExPO-HM。
引用
@article{arxiv.2510.08630,
title = {ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection},
author = {Jingbiao Mei and Mingsheng Sun and Jinghong Chen and Pengda Qin and Yuhong Li and Da Chen and Bill Byrne},
journal= {arXiv preprint arXiv:2510.08630},
year = {2026}
}
备注
ICLR 2026