中文

MonoMobility:从单目视频中零样本 3D 运动分析

计算机视觉与模式识别 2025-07-14 v3

摘要

准确分析动态环境中运动部件及其运动属性对于推动诸如具身智能等关键领域的进展至关重要。针对现有方法依赖稠密多视图图像或详细部件级标注的局限,我们提出一种 innovative 框架,能够以零样本方式从单目视频中进行 3D 运动分析。该框架仅使用单目视频即可精确解析运动部件和运动属性,完全消除对标注训练数据的需求。具体而言,我们的方法首先构建场景几何结构,并结合深度估计、光流分析和点云配准方法,对运动部件及其初始运动属性进行粗略分析,然后采用 2D 高斯溶解进行场景表示。基于此,我们引入一种专为关节物体设计的端到端动态场景优化算法,细化初始分析结果,使系统能够处理“旋转”、“平移”,甚至复杂运动(“旋转+平移”),展现出高灵活性和 versatility。为验证方法的 robust性和广泛适用性,我们创建了一个包含模拟和真实场景的全面数据集。实验结果表明,该框架能够以无标注的方式有效分析关节物体的运动,展现出在未来具身智能应用中的显著潜力。

关键词

引用

@article{arxiv.2505.11868,
  title  = {MonoMobility: Zero-Shot 3D Mobility Analysis from Monocular Videos},
  author = {Hongyi Zhou and Yulan Guo and Xiaogang Wang and Kai Xu},
  journal= {arXiv preprint arXiv:2505.11868},
  year   = {2025}
}