中文

LMM-Track4D:通过轨迹导向对话在大型多模态模型中引发 4D 动态推理

计算机视觉与模式识别 2026-05-20 v1

摘要

近期大型多模态模型 (LMM) 在图像和视频理解方面日益强大,但仍难以维持 4D 连续的时空动态推理。为研究这一能力缺口,我们构方了轨迹导向多轮时空对话,这是一种新任务,要求模型在整个短片或指定较长片段的子片段中,对结构化的 3D 目标轨迹进行回复,同时回答时空查询。我们引入了 Track4D-Bench,该基准包含 526 条片段级别对话样本,覆盖 23.5k 帧和 7.5k 个对象标注,用于训练和评估。基于此任务,我们提出了 LMM-Track4D,它结合了 RTGE (射线-时间几何编码),用于长期动态传播的专用流式状态记token TRK,以及一种用于在遮挡和视角变化下的稳定 4 步 3D 状态估计的 Object-Slot Kinematic, Residual-Anchor (OSK-RA) 解码器。Track4D-Bench 上的实验表明,LMM-Track4D 在强大的基准之间实现了持续的改进,表明在 LMM 中显式的动态状态建模是激发 4D 动态推理的有用设计原则。我们的代码和数据集将在 https://github.com/mikubaka88/LMM-Track4D 上公开。

关键词

引用

@article{arxiv.2605.19390,
  title  = {LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue},
  author = {Chaoyue Li and Yongxue Xu and Jie Feng and Jiayu Ding},
  journal= {arXiv preprint arXiv:2605.19390},
  year   = {2026}
}