中文

理解基于大语言模型的卡通 VQA 中的多智能体推理

计算机视觉与模式识别 2026-01-07 v1

摘要

针对风格化卡通图像的视觉问答(VQA) presents 挑战,例如解释夸张的视觉抽象和叙事驱动的背景,这些挑战未被标准基于自然图像训练的大语言模型(LLM)充分解决。为调查此问题,我们引入一种多智能体 LLM 框架,专为卡通图像的 VQA 任务设计。该框架由三个专用智能体组成:视觉智能体、语言智能体和批判性智能体,它们协作工作,以支持结构化推理,通过整合视觉线索和叙事背景。该框架在两个基于卡通的 VQA 数据集上进行了系统评估:Pororo 和 Simpsons。实验结果对每位智能体对最终预测的贡献进行了详细分析,为更深入地理解 LLM 基于多智能体的行为在卡通 VQA 和多模态推理中提供了洞见。

关键词

引用

@article{arxiv.2601.03073,
  title  = {Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA},
  author = {Tong Wu and Thanet Markchom},
  journal= {arXiv preprint arXiv:2601.03073},
  year   = {2026}
}