中文

Commander-GPT:全面释放多模态大语言模型的讽刺检测能力

计算与语言 2025-07-04 v3 人工智能

摘要

讽刺检测作为自然语言处理 (NLP) 领域的一个重要研究方向,受到了广泛关注。传统的讽刺检测任务通常侧重于单模态方法(例如文本),但由于讽刺的隐含和微妙性质,此类方法往往难以产生令人满意的结果。近年来,研究人员将讽刺检测的重点转向了多模态方法。然而,如何有效利用多模态信息来准确识别讽刺内容仍是一个值得进一步探索的挑战。利用多模态大语言模型 (MLLMs) 对各种信息源的强大综合处理能力,我们提出了一种创新的多模态 Commander-GPT 框架。受军事策略启发,我们首先将讽刺检测任务分解为六个不同的子任务。然后,中央指挥官(决策者)分配最适合的大语言模型来处理每个特定的子任务。最终,将每个模型的检测结果进行聚合以识别讽刺。我们在 MMSD 和 MMSD 2.0 上进行了广泛的实验,利用了四个多模态大语言模型和六种提示策略。我们的实验表明,我们的方法实现了 state-of-the-art 的性能,F1 分数提高了 19.3%,且无需微调或 ground-truth rationales。

关键词

引用

@article{arxiv.2503.18681,
  title  = {Commander-GPT: Fully Unleashing the Sarcasm Detection Capability of Multi-Modal Large Language Models},
  author = {Yazhou Zhang and Chunwang Zou and Bo Wang and Jing Qin},
  journal= {arXiv preprint arXiv:2503.18681},
  year   = {2025}
}

备注

Our original goal was to use Commander-GPT: Dividing and Routing for Multimodal Sarcasm Detection (arXiv:2506.19420) to replace Commander-GPT: Fully Unleashing the Sarcasm Detection Capability of Multi-Modal Large Language Models (arXiv:2503.18681). Due to various reasons, both versions were released, so we would like to withdraw the latter