连续感知至关重要:诊断多模态模型中的时间整合失败
计算机视觉与模式识别
2025-12-02 v2
摘要
连续感知,即以连续流的方式在时间上整合视觉观测,对于鲁棒的现实世界理解至关重要,但在当前多模态模型中仍基本未被检验。我们引入了 CP-Bench,一个最小且完全受控的基准,旨在通过一个极其简单的任务来隔离这一能力:在合成场景中计数相同立方体,同时相机移动且任意时刻仅揭示部分物体。尽管设置简单,我们发现包括 Qwen-3-VL、InternVL3、GPT-5 和 Gemini-3-Pro 在内的最先进开源和商业模型均表现严重失败。静态相机对照变体确认失败并非源于物体识别,而是源于无法跨时间累积证据。进一步实验表明,更高的采样帧率、感知增强或空间增强模型,以及使用额外视频进行微调,均无法带来有意义的时间跨泛化。我们的结果揭示了现代多模态架构与训练范式中的根本性局限。CP-Bench 提供了一个简单而强大的诊断工具,并为开发具备真正时间一致性视觉推理能力的模型建立了干净的测试平台。
引用
@article{arxiv.2408.07867,
title = {Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models},
author = {Zeyu Wang and Zhenzhen Weng and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2408.07867},
year = {2025}
}