中文

Commander-GPT:用于多模态讽刺检测的划分与路由

人工智能 2026-04-09 v2

摘要

多模态讽刺理解是一种高阶认知任务。尽管大型语言模型(LLM)在许多下游NLP任务上展现出惊人的性能,但不断出现的证据表明它们在讽刺理解方面存在困难。本文提出Commander-GPT,一种受军事指挥理论启发的模块化决策路由框架。不依赖单一LLM的能力,Commander-GPT协调由多个专职LLM代理组成的团队,每位代理被指定执行诸如关键词提取、情感分析等特定子任务。随后,这些代理的输出被路由回指挥官,指挥官整合信息并进行最终的讽刺判断。为协调这些代理,我们引入三种类型的中心指挥官:(1)一种基于训练的轻量级编码器指挥官(例如,多模态BERT);(2)四个小型自回归语言模型,作为中等能力的指挥官(例如,DeepSeek-VL);(3)两个大型LLM指挥官(Gemini Pro和GPT-4o),以零样本方式执行任务路由、输出聚合和讽刺决策。我们在MMSD和MMSD 2.0基准上评估了Commander-GPT,比较了五种提示策略。实验结果表明,我们的框架在平均情况下相对于最先进(SOTA)基线提高了4.4%和11.7%的F1分数,显示其有效性。

关键词

引用

@article{arxiv.2506.19420,
  title  = {Commander-GPT: Dividing and Routing for Multimodal Sarcasm Detection},
  author = {Yazhou Zhang and Chunwang Zou and Bo Wang and Jing Qin and Prayag Tiwari},
  journal= {arXiv preprint arXiv:2506.19420},
  year   = {2026}
}