中文

穿越坑洞,获益于智慧:基于误判风险模式检索的认知引导有害表情包检测

机器学习 2026-04-17 v3 人工智能 密码学与安全

摘要

网络表情包日益成为流行的多模态媒介,但正被武化化以隐式修辞手段(如讽刺和隐喻)传递有害意见。现有检测方法,包括基于多模态大语言模型 (MLLM) 的技术,难以处理这些隐式表达,导致频繁误判。本文引入 PatMD,一种通过学习和主动缓解潜在误判风险来检测有害表情包的新方法。我们的核心思想是超越浅层内容级匹配,识别底层误判风险模式,主动引导 MLLM 避免已知的误判陷阱。我们首先构建知识库,将每个表情包解构为解释其可能被误判的误判风险模式(要么忽视有害暗示(假阴性),要么过度解读良性内容(假阳性))。针对给定目标表情包,PatMD 检索相关模式并利用其动态引导 MLLM 的推理。实验在包含 6,626 个表情包的基准数据集上进行,覆盖 5 个有害检测任务,表明 PatMD 在 F1 分数提升平均 8.30%,在准确率提升 7.71%,并在未见及对抗性表情包上表现出一致的鲁棒性。

关键词

引用

@article{arxiv.2510.15946,
  title  = {Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval},
  author = {Wenshuo Wang and Ziyou Jiang and Junjie Wang and Mingyang Li and Jie Huang and Yuekai Huang and Zhiyuan Chang and Feiyan Duan and Qing Wang},
  journal= {arXiv preprint arXiv:2510.15946},
  year   = {2026}
}

备注

14 pages, 11 figures