sim2art:仅使用合成训练数据从单目视频中精确建模可铰接物体
计算机视觉与模式识别
2026-03-24 v3 机器人学
摘要
从单目视频中理解可铰接物体是机器人学和数字孪生创建中的一项关键且具有挑战性的任务。现有方法通常依赖复杂的多视角设置、高精度物体扫描,或在随意真实世界拍摄中经常失效的脆弱长时点轨迹。在本文中,我们提出了 sim2art,一个数据驱动的框架,可从单台自由移动相机拍摄的单目视频中恢复可铰接物体的 3D 部件分割和关节参数。我们的核心洞察是基于逐帧表面点采样的鲁棒表示,我们将其与短期场景流和 DINOv3 语义特征相结合。与依赖易出错的长时对应的先前工作不同,我们的表示易于获取,且在无需域适应的情况下,仿真与现实之间的差异可忽略不计。此外,通过构造,我们的方法依赖单视角可见性,确保几何表示在合成数据和真实数据之间保持一致,即使存在噪声和遮挡。利用合适的 Transformer 架构,sim2art 仅使用合成数据进行训练,却能强泛化到真实世界序列。为解决该领域缺乏标准化基准的问题,我们引入了两个数据集,其物体类别和实例的多样性显著高于先前工作。我们的评估表明,sim2art 能有效处理大相机运动和复杂铰接,优于最先进的基于优化的和依赖跟踪的方法。sim2art 提供了一种可扩展的解决方案,可轻松扩展至新物体类别,无需繁琐的真实世界标注。项目网页:https://aartykov.github.io/sim2art/
引用
@article{arxiv.2512.07698,
title = {sim2art: Accurate Articulated Object Modeling from a Single Video using Synthetic Training Data Only},
author = {Arslan Artykov and Tom Ravaud and Corentin Sautier and Vincent Lepetit},
journal= {arXiv preprint arXiv:2512.07698},
year = {2026}
}