MMCTAgent:面向复杂视觉推理的多模态批判性思维代理框架
计算与语言
2024-05-29 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
近期多模态大语言模型(MLLMs)的快速进步显著提升了其在视觉与语言融合任务中的性能,但在细致的多模态理解、复杂任务的 Comprehension 以及多模态信息的推理方面仍面临挑战。本文引入 MMCTAgent,一种新型多模态批判性思维代理框架,旨在解决当前 MLLMs 在复杂视觉推理任务中固有的局限性。灵感来自人类认知过程和批判性思维,MMCTAgent 通过迭代分析多模态信息、分解查询、规划策略并动态演化其推理过程。此外,MMCTAgent 引入了批判性思维元素,包括对最终答案的验证和自我反思,采用一种新颖方法定义基于视觉的批评家并识别任务特定的评估标准,从而提升其决策能力。通过在各种图像和视频理解基准上的严格评估,我们展示了 MMCTAgent(带或不带批评家)均优于基础 MLLMs 和其他工具增强型管道。
引用
@article{arxiv.2405.18358,
title = {MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning},
author = {Somnath Kumar and Yash Gadhia and Tanuja Ganu and Akshay Nambi},
journal= {arXiv preprint arXiv:2405.18358},
year = {2024}
}