中文

带置信度的视觉与推理:通过不确定性感知的智能体框架增强多模态大语言模型

人工智能 2025-03-12 v1

摘要

多模态大语言模型(MLLM)在视觉问答(VQA)等任务中展现出潜力,但在多模态推理中仍面临挑战。近期工作通过适配智能体框架或思维链(CoT)推理来提升性能。然而,基于 CoT 的多模态推理通常需要昂贵的数据标注和微调,而依赖外部工具的智能体方法则面临引入这些工具不可靠输出的风险。本文提出 Seeing and Reasoning with Confidence(SRICE),一个无需训练的多模态推理框架,将带有不确定性量化(UQ)的外部视觉模型集成到 MLLM 中以应对这些挑战。具体而言,SRICE 允许 MLLM 在外部工具辅助下通过多阶段交互自主选择感兴趣区域,以此引导推理过程。我们提出使用基于保形预测的方法来校准外部工具的输出,并通过估计 MLLM 输出的不确定性来选择最优工具。实验表明,SRICE 在五个数据集上相对于基础 MLLM 的平均提升为 4.6%,在部分数据集上的性能甚至优于基于微调的方法,这揭示了在 MLLM 智能体中确保可靠工具使用的重要性。

关键词

引用

@article{arxiv.2503.08308,
  title  = {Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework},
  author = {Zhuo Zhi and Chen Feng and Adam Daneshmend and Mine Orlu and Andreas Demosthenous and Lu Yin and Da Li and Ziquan Liu and Miguel R. D. Rodrigues},
  journal= {arXiv preprint arXiv:2503.08308},
  year   = {2025}
}