图像思维提示:多模态大型语言模型中的视觉推理细化
人工智能
2024-05-30 v2 计算与语言
计算机视觉与模式识别
摘要
最近在思维链(CoT)和相关基于推理的工作方面的进展显著提高了大型语言模型(LLM)在复杂推理任务中的性能。随着多模态大型语言模型(MLLM)的发展,增强其处理复杂多模态推理问题的能力是一个关键前沿。然而,在CoT中融入多模态推理尚未得到深入研究。我们提出了图像思维(IoT)提示方法,帮助MLLM逐步提取视觉推理。具体来说,IoT提示可以根据输入图像和问题自动设计关键的视觉信息提取操作。每一步视觉信息细化都会识别出支持回答复杂视觉推理问题的特定视觉推理。除了文本CoT,IoT同时利用视觉和文本推理来帮助MLLM理解复杂的多模态信息。IoT提示在各种视觉理解任务中提高了不同MLLM的零样本视觉推理性能。此外,IoT提示生成的逐步视觉特征解释阐明了视觉推理过程,有助于分析大型多模态模型的认知过程。
引用
@article{arxiv.2405.13872,
title = {Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models},
author = {Qiji Zhou and Ruochen Zhou and Zike Hu and Panzhong Lu and Siyang Gao and Yue Zhang},
journal= {arXiv preprint arXiv:2405.13872},
year = {2024}
}
备注
Correct the case title