ProCrit:基于批判引导修订的自激发多视角推理用于多模态讽刺检测
多智能体系统
2026-05-21 v1 计算机视觉与模式识别
摘要
多模态讽刺检测需要在字面表达与意图含义之间的跨模态不一致性上进行推理,但具体所需的分析视角因讽刺机制的多样性而在不同样本之间各异。虽然近期方法使分析过程显式化,但仍依赖于在手工路由规则下独立运行的固定、预定义视角。我们认为,多模态讽刺检测应要求自激发的多视角推理,即模型为每个样本自主生成所需视角,并逐步将其整合为连贯的分析。为实现这一目标,我们提出 ProCrit,一个提案-批判两智能体框架,其中包含用于多视角推理的提案智能体和用于外部评估和目标修订指导的批判智能体。首先,为克服现有讽刺数据集缺乏过程级监督,ProCrit 通过动态角色智能体 rollout 合成过程级推理注释:一个强大的视觉-语言模型依次在共享上下文中生成分析角色,而 resulting 多角色轨迹被平坦化为保留跨视角依赖性的序列,以高效的自回归生成方式呈现。其次,为提高推理可靠性,ProCrit 采用草稿-批判-修订范式,其中独立的批判智能体识别推理缺陷并提供针对性的自然语言反馈以实现定向修订。最后,我们开发了双阶段强化学习的相互精炼训练框架,以联合优化提案草稿和反馈引导的修订,同时根据反馈实际效果精炼批判智能体。在三个广泛使用的数据集上的实验表明,ProCrit 的效果显著。
引用
@article{arxiv.2605.20867,
title = {ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection},
author = {Yingjia Xu and Jiulong Wu and Bowen Zhang and Baokui Guo and Siyuan Chai and Min Cao},
journal= {arXiv preprint arXiv:2605.20867},
year = {2026}
}