中文

WorldSense:评估多模态大语言模型的真实世界全模态理解能力

计算机视觉与模式识别 2026-03-03 v3 人工智能

摘要

我们提出 WorldSense,首个评估多模态视频理解基准,同时覆盖视觉、音频与文本输入。与现有基准不同,WorldSense 拥有以下特点:(i) 多模态协同,我们设计的评估任务强烈耦合音频与视频,要求模型有效利用全模态的感知协同;(ii) 内容多样性,WorldSense 包含 1,662 个音视频同步视频,系统划分为 8 大类 67 小类的细分领域,涵盖广泛场景;3,172 对多选问答配对分布于 26 种不同任务,实现全面评估;(iii) 高质量标注,所有问答配对均由 80 名专家标注员多轮校正后确保质量。基于 WorldSense,我们广泛评估了各类最新模型。实验结果表明,现有模型在理解真实场景时面临重大挑战(最佳准确率仅 65.1%)。通过分析当前模型的局限性,我们旨在为指导后续模型开发提供有价值的洞见。我们期望 WorldSense 能为评估模型从全模态构建与理解连贯语境的能力提供平台。

关键词

引用

@article{arxiv.2502.04326,
  title  = {WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs},
  author = {Jack Hong and Shilin Yan and Jiayin Cai and Xiaolong Jiang and Yao Hu and Weidi Xie},
  journal= {arXiv preprint arXiv:2502.04326},
  year   = {2026}
}

备注

Accepted by ICLR2026