中文

粗粒度对应增强多模态语言模型的时空推理能力

计算机视觉与模式识别 2024-11-22 v2 机器学习

摘要

多模态语言模型(MLLM)越来越多地被应用于真实世界环境,需要其具备解释三维空间和理解时间动态的能力。当前方法通常依赖专门的架构设计或任务特定的微调来实现这一点。我们提出 Coarse Correspondences,一种简单轻量的方法,通过 2D 图像作为输入增强 MLLM 的时空推理能力,无需修改架构或进行任务特定的微调。我们的方法使用轻量跟踪模型来识别视频帧之间或不同图像视角之间的主要对象对应,然后通过视觉提示将此信息传递给 MLLM。我们证明这种简单的无需训练方法在四个需要时空推理的基准测试上为 GPT-4V/O 带来了显著提升,包括 ScanQA 上 +20.5%、OpenEQA 的情景记忆子集上 +9.7%、长视频基准 EgoSchema 上 +6.0% 以及 R2R 导航基准上 +11%。此外,我们证明 Coarse Correspondences 也能增强开源 MLLM 的空间推理能力(ScanQA 上 +6.9%),当同时应用于训练和推理时,且该提升可以泛化到未见数据集如 SQA3D(+3.1%)。总之,我们证明 Coarse Correspondences 有效且高效地提升了模型在下游时空推理任务上的性能。

关键词

引用

@article{arxiv.2408.00754,
  title  = {Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model},
  author = {Benlin Liu and Yuhao Dong and Yiqin Wang and Zixian Ma and Yansong Tang and Luming Tang and Yongming Rao and Wei-Chiu Ma and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2408.00754},
  year   = {2024}
}

备注

project page: https://coarse-correspondence.github.io