中文

通过4D逃脱房间任务评估大模型的时间感知与跨模态主动感知

计算机视觉与模式识别 2026-03-17 v1

摘要

多模态大语言模型(MLLM)最近在向统一全息模型的发展,集成了视觉、语言和音频。然而,现有环境主要关注2D或3D视觉上下文和视觉语言任务,为时序相关的听觉信号和选择性跨模态集成提供的支持有限,这些是现实多模态推理中必不可少的能力。结果是,模型是否能够主动协调模态并在时变、不可逆条件下进行推理,仍未得到充分探索。为此,我们引入EscapeCraft-4D,用于评估选择性跨模态感知和时间 awareness 的全息模型。它包含基于触发器的听觉来源、时序暂态证据和位置相关线索,需要代理执行时空推理和主动多模态集成,同时受时间限制。基于该环境,我们精选了基准测试,以评估对应能力。评估结果表明,模型在模态偏见方面存在困难,并揭示了当前模型在时限条件下整合多个模态的能力存在显著差距。进一步的深入分析揭示了多个模态如何相互作用并在复杂多模态推理环境中共同影响模型决策。

关键词

引用

@article{arxiv.2603.15467,
  title  = {Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task},
  author = {Yurui Dong and Ziyue Wang and Shuyun Lu and Dairu Liu and Xuechen Liu and Fuwen Luo and Peng Li and Yang Liu},
  journal= {arXiv preprint arXiv:2603.15467},
  year   = {2026}
}