LLaVA-4D:将时空提示嵌入LMM以实现4D场景理解
计算机视觉与模式识别
2025-05-20 v1
摘要
尽管在2D图像理解方面取得了显著进展,大型多模态模型(LMM)在物理世界中仍因缺乏空间表示而难以应对。通常,现有的3D LMM主要将3D位置作为固定的空间提示嵌入到视觉特征中,以表示场景。然而,这些方法仅限于理解静态背景,无法捕捉具有变化的动态对象。在本文中,我们提出了LLaVA-4D,一种具有新颖时空提示的通用LMM框架,用于4D场景的视觉表示。时空提示通过对3D位置和1D时间编码为动态感知的4D坐标嵌入生成。此外,我们证明了从视觉特征中分离的时空成分在区分背景与物体方面更为有效。这激励我们将4D时空提示嵌入这些特征以增强动态场景表示。通过将视觉时空嵌入与语言嵌入对齐,LMM获得了理解静态背景和动态对象在空间和时间上的特征的能力。此外,我们构建了一个带有时空坐标注释的4D视觉语言数据集,用于指令微调LMM。广泛的实验表明,我们的方法在4D场景理解的不同任务中效果显著。
引用
@article{arxiv.2505.12253,
title = {LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding},
author = {Hanyu Zhou and Gim Hee Lee},
journal= {arXiv preprint arXiv:2505.12253},
year = {2025}
}