4D-Bench:面向 4D 对象理解的多模态大语言模型基准
计算机视觉与模式识别
2025-03-25 v1
摘要
多模态大语言模型(MLLMs)已在2D图像/视频理解方面展现出惊人的能力。然而,目前尚无公开标准化基准来评估MLLMs理解4D对象(3D对象随时间演化)的能力。本文我们引入4D-Bench,这是第一个用于评估MLLMs 4D对象理解能力的基准,包含4D对象问答(4D object QA)和4D对象描述等任务。4D-Bench提供具有多样类别的4D对象、高质量注释以及需要多视角时空理解的任务,与现有的基于2D图像/视频的基准不同。通过4D-Bench,我们评估了广泛的开源和闭源 MLLMs。4D对象描述实验结果表明,MLLMs在时序理解方面通常表现弱于外观理解,尽管开源模型在外观理解方面接近闭源模型的性能,但在时序理解方面表现出更大的性能差距。4D对象问答结果令人惊讶:即使在简单单对象视频上,MLLMs的表现也很差,最先进的GPT-4o仅达到63%的准确率,而人类基准为91%。这些发现凸显了4D对象理解中的显著差距,以及MLLMs进一步发展的必要性。
引用
@article{arxiv.2503.17827,
title = {4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding},
author = {Wenxuan Zhu and Bing Li and Cheng Zheng and Jinjie Mai and Jun Chen and Letian Jiang and Abdullah Hamdi and Sara Rojas Martinez and Chia-Wen Lin and Mohamed Elhoseiny and Bernard Ghanem},
journal= {arXiv preprint arXiv:2503.17827},
year = {2025}
}