中文

PrismAgent:基于零样态可解释多智能体框架揭示表情包中的有害内容

机器学习 2026-05-06 v1 人工智能

摘要

表情包的快速传播使得有害内容检测日益关键,有效识别可遏制虚假信息的扩散。然而,现有方法高度依赖大量标注数据,导致巨大的训练成本和有限的泛化。为此,我们提出 PrismAgent,一个零样态、多智能体、可解释框架。PrismAgent 将此任务概念化为刑事案件调查,采用四个专门智能体负责分析、调查、起诉和裁决阶段的结构化协作工作流程。在第一阶段,分析师智能体在善意和恶意假设下对每个表情包进行改写,以探测其潜在意图。调查员智能体随后从未标注的数据集中检索支持证据并构建表情包及其变体的情境解释。接着,起诉官智能体以三种独立的初步判断,对原始表情包与每个解释进行配对。最后,裁决官智能体在所有证据基础上作出最终裁决。此外,PrismAgent 明确的多阶段推理链使模型本质上可解释,每个中间步骤都得到显式解释,而不仅仅是输出最终检测结果。广泛实验表明,PrismAgent 在三个公开数据集上显著优于现有零样态检测方法。

关键词

引用

@article{arxiv.2605.02940,
  title  = {PrismAgent: Illuminating Harm in Memes via a Zero-Shot Interpretable Multi-Agent Framework},
  author = {Zihan Ding and Ziyuan Yang and Yi Zhang},
  journal= {arXiv preprint arXiv:2605.02940},
  year   = {2026}
}