中文

MIND:面向零样态有害表情包检测的多智能体框架

计算与语言 2025-07-10 v1 人工智能

摘要

社交媒体上表情包的快速扩张凸显了检测有害内容的迫切需求。然而,传统的数据驱动方法因表情包不断演变及缺乏及时标注数据而难以检测新型表情包。为此,我们提出MIND(Multi-agent Framework for zero-shot Harmful meme Detection),一种无需依赖标注数据的零样态有害表情包检测多智能体框架。MIND实现了三大关键策略:1)从未标注的参考集合中检索相似表情包以提供上下文信息;2)提出双向洞察推导机制,以全面理解相似表情包;3)采用多智能体辩论机制,通过理性仲裁确保决策的鲁棒性。在三个表情包数据集上的大规模实验表明,我们提出的框架不仅优于现有零样态方法,还在不同模型架构和参数规模间展现出强大的泛化能力,为有害表情包检测提供了可扩展的解决方案。代码已公开于 https://github.com/destroy-lonely/MIND。

关键词

引用

@article{arxiv.2507.06908,
  title  = {MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection},
  author = {Ziyan Liu and Chunxiao Fan and Haoran Lou and Yuexin Wu and Kaiwei Deng},
  journal= {arXiv preprint arXiv:2507.06908},
  year   = {2025}
}

备注

ACL 2025