FunRec:从 egocentric 交互视频重建功能性 3D 场景
计算机视觉与模式识别
2026-04-28 v2
摘要
我们提出 FunRec(功能场景重建方法),用于从 egocentric RGB-D 交互视频直接重建功能性 3D 数字孪生体。不同于现有基于关节 articulation 的方法依赖受控环境、多状态捕获或 CAD 先验,FunRec 能直接处理野生态人类交互序列,以可交互的 3D 场景为目标。它自动发现关节部件、估计运动学参数、跟踪其 3D 运动,并在标准空间中重建静态与动态几何体,生成与仿真兼容的网格模型。在新的真实与模拟基准测试中,FunRec 以显著优于先前工作的水平表现,实现了在部件分割上最高可达 +50 mIoU 的提升、5-10 倍的关节误差和姿态误差降低,以及显著提升的重建精度。我们进一步展示了在 URDF/USD 导出用于仿真、手指引导的可 affordance 映射以及机器人-场景交互等实际应用场景。
引用
@article{arxiv.2604.05621,
title = {FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos},
author = {Alexandros Delitzas and Chenyangguang Zhang and Alexey Gavryushin and Tommaso Di Mario and Boyang Sun and Rishabh Dabral and Leonidas Guibas and Christian Theobalt and Marc Pollefeys and Francis Engelmann and Daniel Barath},
journal= {arXiv preprint arXiv:2604.05621},
year = {2026}
}
备注
CVPR 2026. Project page: https://functionalscenes.github.io