当看似足够时:揭示多模态大语言模型主动推理能力的限制
计算与语言
2025-10-20 v1
摘要
多模态大语言模型(MLLMs)在广泛的基准测试中展现出强大的能力。然而,大多数现有评估都聚焦于被动推理,即模型在完全信息下进行逐步推理。这种设置与现实应用场景不符,因为看似足够时并非总是如此。这引出一个根本性问题:在信息不完整的情况下,MLLMs 是否能够主动获取缺失的证据?为弥合这一差距,我们要求 MLLMs 在信息不完整的情况下主动获取缺失的证据并迭代地细化决策,通过从候选图像池中选择目标图像(无需特定于任务的先验信息)来实现。为支持系统性研究,我们提出了 GuessBench—a 一个包含感知导向和知识导向图像的数据集,用于评估 MLLMs 的主动推理能力。我们评估了 20 项优秀 MLLMs,发现其在主动推理上的表现远低于被动设置,表明仍有显著的提升空间。进一步分析识别出细粒度感知和及时决策是关键挑战。消融研究表明,感知增强对较小模型有益,而以思考为导向的方法在不同模型规模上都能提供持久的收益。这些结果指向了未来在多模态主动推理方面的有前景的研究方向。
引用
@article{arxiv.2510.15421,
title = {When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs},
author = {Hongcheng Liu and Pingjie Wang and Yuhao Wang and Siqu Ou and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2510.15421},
year = {2025}
}
备注
20 pages, 13 figures