我的视频 LMM 有多好?复杂视频推理与鲁棒性评估套件
计算机视觉与模式识别
2024-05-10 v2
摘要
近期大语言模型(LLM)的进展推动了视频大型多模态模型(Video-LMM)的发展,这些模型能够处理广泛的视频理解任务。这些模型有望在机器人、AI 助手、医疗手术和自动驾驶等实际应用中部署。Video-LMM 在日常生活中的广泛应用凸显了确保其在复杂真实场景中表现出人类般推理和交互能力的重要性。然而,现有 Video-LMM 基准主要关注一般视频理解能力,却忽略了从用户提示(文本查询)这一视角评估其在复杂真实情境下的推理能力和鲁棒性。本文提出了复杂视频推理与鲁棒性评估套件(CVRR-ES),这是一套新型基准,全面评估 Video-LMM 在 11 个多样化真实视频维度上的表现。我们评估了 9 个最新模型,包括开源和闭源变体,发现大多数 Video-LMM,尤其是开源模型,在处理复杂视频时在鲁棒性和推理方面表现不佳。基于我们的分析,我们开发了一种无训练的双步情境提示(DSCP)技术来提升现有 Video-LMM 的性能。我们的发现为构建下一代具备先进鲁棒性和推理能力的人类中心 AI 系统提供了宝贵见解。我们的数据集和代码已公开发布于 https://mbzuai-oryx.github.io/CVRR-Evaluation-Suite/。
引用
@article{arxiv.2405.03690,
title = {How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs},
author = {Muhammad Uzair Khattak and Muhammad Ferjad Naeem and Jameel Hassan and Muzammal Naseer and Federico Tombari and Fahad Shahbaz Khan and Salman Khan},
journal= {arXiv preprint arXiv:2405.03690},
year = {2024}
}
备注
Technical report