中文

决策之前先审视:提示多模态大语言模型进行假设性推理的主动推断

计算机视觉与模式识别 2025-04-18 v5 人工智能

摘要

近期,多模态大语言模型(MLLMs)凭借其出色的指令遵循能力和广泛的世界知识,在多个领域取得了显著成功。然而,这些MLLMs是否具备类似人类的组合推理能力仍是一个悬而未决的问题。为了揭示其推理行为,我们首先在本文中构建了一个多模态假设推理基准(MARS-Bench)。有趣的是,我们发现大多数主流的MLLMs很容易被在问题中引入预设条件所愚弄,而这些预设条件对人类推理来说显得很幼稚。此外,我们还提出了一种简单而有效的方法——主动推断(AD),这是一种新颖的强化学习范式,旨在鼓励模型在做出最终决定之前主动执行复合推断。配备了所提出的AD方法后,MLLM在假设性推理能力上表现出显著提升,同时未损害其通用问答性能。我们还在MARS-Bench上对开源和私有MLLMs进行了广泛评估,并提供了AD方法的实验分析。

关键词

引用

@article{arxiv.2404.12966,
  title  = {Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning},
  author = {Yian Li and Wentao Tian and Yang Jiao and Jingjing Chen and Tianwen Qian and Bin Zhu and Na Zhao and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2404.12966},
  year   = {2025}
}