ActiView:评估多模态大语言模型主动感知能力
计算机视觉与模式识别
2025-04-10 v2
摘要
主动感知是人类至关重要的能力,涉及根据对环境的当前理解设定目标,并执行动作以实现该目标。尽管在评估多模态大语言模型(MLLMs)方面有着显著的努力,但主动感知 largely 被忽视了。为弥补这一差距,我们提出了一个新的基准测试,称为 ActiView,用于评估 MLLMs 的主动感知能力。我们专注于一种特殊形式的视觉问答(VQA),该形式既简化又量化了现有 MLLMs 面临的挑战。同时,也讨论了模型的中间推理行为。给定一张图像,我们限制模型的感知范围,要求其根据推理主动放大或偏移感知范围,以成功回答问题。在30个模型(包括专有和开源模型)上进行了广泛的评估,我们观察到受限的感知范围在启用主动感知方面发挥着重要作用。结果揭示了 MLLMs 主动感知能力之间的显著差距,表明该领域值得更多关注。我们希望 ActiView 能帮助开发出更自然和全面地理解多模态输入的方法。
引用
@article{arxiv.2410.04659,
title = {ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models},
author = {Ziyue Wang and Chi Chen and Fuwen Luo and Yurui Dong and Yuanchi Zhang and Yuzhuang Xu and Xiaolong Wang and Peng Li and Yang Liu},
journal= {arXiv preprint arXiv:2410.04659},
year = {2025}
}