中文

PhyVLLM:基于运动-外观解耦的物理引导视频语言模型

计算机视觉与模式识别 2025-12-05 v1 人工智能

摘要

视频大语言模型(Video LLM)在广泛的视频语言任务中展现出惊人的性能。然而,它们在需要对物理动力学进行深入理解的场景中往往难以胜任。这一限制主要源于其依赖基于外观的匹配。将物理运动建模纳入其中对于实现更深入的视频理解至关重要,但带来了三个关键挑战:(1)运动信号常与外观变化 entangled 在一起,导致难以提取干净的物理线索;(2)有效的运动建模不仅需要连续时间的运动表示,还需要捕捉物理动力学;(3)为物理属性收集准确标注成本高昂且往往不可行。为此,我们提出PhyVLLM,一个物理引导的视频语言框架,显式地将物理运动纳入视频语言模型中。具体而言,PhyVLLM通过双分支编码器解耦视觉外观和物体运动。为建模随时间推移的物理动力学,我们引入神经常微分方程(Neural ODE)模块,生成可微的物理动态表示。 resulting motion-aware representations被投影到预训练LLM的token空间,实现物理推理,同时不牺牲模型原始的多模态能力。为规避对物理标签的依赖,PhyVLLM采用自监督方式建模物体运动的连续演化。实验结果表明,PhyVLLM在物理推理和一般视频理解任务上均显著优于当前SOTA视频语言模型,凸显了纳入显式物理建模的优势。

关键词

引用

@article{arxiv.2512.04532,
  title  = {PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement},
  author = {Yu-Wei Zhan and Xin Wang and Hong Chen and Tongtong Feng and Wei Feng and Ren Wang and Guangyao Li and Qing Li and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2512.04532},
  year   = {2025}
}