中文

IRONIC:基于多模态语义连贯性的推理链用于多模态讽刺检测

计算与语言 2025-08-26 v2 人工智能 计算机视觉与模式识别

摘要

跨模态输入解读修辞语言如讽刺具有独特挑战,往往需要任务特定的微调和大量推理步骤。然而,当前的链式思考方法未能有效利用人类识别讽刺所依赖的认知过程。我们提出 IRONIC,一个利用多模态语义连贯性进行的原语学习框架,用于分析指代、类比和语用图像-文本联系。我们的实验表明,IRONIC 在不同基线上的零样态多模态讽刺检测中实现了最先进的性能。这表明在多模态推理策略设计中纳入语言和认知见解的必要性。我们的代码已公开:https://github.com/aashish2000/IRONIC

关键词

引用

@article{arxiv.2505.16258,
  title  = {IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection},
  author = {Aashish Anantha Ramakrishnan and Aadarsh Anantha Ramakrishnan and Dongwon Lee},
  journal= {arXiv preprint arXiv:2505.16258},
  year   = {2025}
}

备注

Accepted in the COLM First Workshop on Pragmatic Reasoning in Language Models (PragLM), Montreal, Canada, October 2025, https://sites.google.com/berkeley.edu/praglm