GRASP:面向多模态讽刺目标识别的 grounding CoT 推理与双阶段优化
计算与语言
2026-04-13 v1
摘要
在传统二分类范式的多模态讽刺检测基础之上,多模态讽刺目标识别(MSTI)提出了更具挑战性的任务,需要精确定位细粒度目标,如文本短语和视觉区域。现有方法主要依赖隐式跨模态对齐,解释性有限且细粒度定位次优。为此,我们提出GRASP框架,即Grounded Chain-of-Thought ReAsoning with Dual-Stage Optimization for Multimodal Sarcasm Prediction and Target Identification,集成视觉 grounding 与显式链式思维(CoT)推理,超越黑箱MSTI。具体而言,我们策划了改进的MSTI-MAX数据集,缓解类别不平衡并丰富多模态讽刺线索。我们引入Grounded CoT推理,显式锚定讽刺相关视觉区域于推理轨迹中,并引导模型在预测最终分类标签与讽刺目标之前 articulates rationales。进一步采用双阶段结果监督联合优化策略: Supervised Fine-Tuning with coordinate-aware weighted loss,随后是 Fine-Grained Target Policy Optimization。大量实验表明,GRASP在跨模态的细粒度讽刺目标识别方面超越现有基线,LLM-as-a-Judge评估量化了内部推理链的质量。我们的数据集与源码将发布于GitHub。
引用
@article{arxiv.2604.08879,
title = {GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification},
author = {Faxian Wan and Xiaocui Yang and Yifan Cao and Shi Feng and Daling Wang and Yifei Zhang},
journal= {arXiv preprint arXiv:2604.08879},
year = {2026}
}