探索多模态大语言模型的推理能力:多模态推理新兴趋势综合综述
计算与语言
2024-01-19 v2 人工智能
摘要
具备抽象推理能力的强人工智能(Strong AI)或通用人工智能(AGI)是下一代AI的目标。大语言模型(LLMs)的最新进展,以及新兴的多模态大语言模型(MLLMs)领域,已在广泛的多模态任务和应用中展现出令人印象深刻的能力。特别是,各种具有不同模型架构、训练数据和训练阶段的 MLLMs,已在广泛的 MLLM 基准上进行了评估。这些研究在不同程度上揭示了 MLLMs 当前能力的不同方面。然而,MLLMs 的推理能力尚未得到系统性研究。在本综述中,我们全面回顾了现有的多模态推理评估协议,对 MLLMs 的前沿进行了分类和说明,介绍了 MLLMs 在推理密集型任务上的应用最新趋势,并最终讨论了当前的实践和未来方向。我们相信,我们的综述为多模态推理这一重要主题奠定了坚实的基础并提供了启示。
引用
@article{arxiv.2401.06805,
title = {Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning},
author = {Yiqi Wang and Wentao Chen and Xiaotian Han and Xudong Lin and Haiteng Zhao and Yongfei Liu and Bohan Zhai and Jianbo Yuan and Quanzeng You and Hongxia Yang},
journal= {arXiv preprint arXiv:2401.06805},
year = {2024}
}