本质铰接:基于单段随手拍摄视频的基元驱动铰接物体理解
计算机视觉与模式识别
2026-05-19 v1
摘要
从单目视频中恢复铰接物体的 3D 运动学是计算机视觉中的一项基础挑战。现有方法依赖于复杂的视频设置或诸如长期点跟踪、宽基线匹配等线索,但在严重遮挡、快速相机自运动或微弱局部特征下往往表现脆弱。同时,基于学习的方法难以泛化至其训练类别之外。我们提出了一种与类别无关的优化框架,将铰接物体理解视为基元拟合问题。几何基元作为一种代理表示,避免了不稳定点轨迹的缺陷;一种新颖的机制将它们组织成受旋转关节和移动关节约束的连贯部件。我们的公式联合优化部件分割与关节参数,从单段随手拍摄的视频中恢复复杂的运动学。一种感知可见性的过程处理了真实世界数据固有的部分观测和遮挡。我们还提出了 AiP-synth 和 AiP-real 基准,其包含显著的相机运动和严重遮挡,并优于现有方法。项目页面:https://aartykov.github.io/Articulation-in-Prime/
引用
@article{arxiv.2605.18645,
title = {Articulation in Prime: Primitive-Based Articulated Object Understanding from a Single Casual Video},
author = {Arslan Artykov and Tom Ravaud and Nicolás Violante-Grezzi and Vincent Lepetit},
journal= {arXiv preprint arXiv:2605.18645},
year = {2026}
}