零样态从视频重建场景内物体操作
计算机视觉与模式识别
2025-12-23 v1 机器人学
摘要
我们构建了第一个解决从单目 RGB 视频重建场景内物体操作的问题的系统。由于场景重建不唯一、手部-物体深度模糊,以及需要满足物理可行性约束,该问题具有挑战性。现有方法基于手部中心坐标工作,忽略场景信息,限制了度量精度和实际应用。我们的方法首先使用数据驱动的基础模型初始化核心组件,包括物体网格和姿态、场景点云以及手部姿态。随后应用两阶段优化,从抓握到相互作用的完整手部-物体运动,并与输入视频中观察到的场景信息保持一致。
引用
@article{arxiv.2512.19684,
title = {Zero-shot Reconstruction of In-Scene Object Manipulation from Video},
author = {Dixuan Lin and Tianyou Wang and Zhuoyang Pan and Yufu Wang and Lingjie Liu and Kostas Daniilidis},
journal= {arXiv preprint arXiv:2512.19684},
year = {2025}
}