从第三人称视频中建模交互式 3D 对象的 EgoFun3D:基于函数模板
计算机视觉与模式识别
2026-04-14 v1
摘要
我们提出 EgoFun3D,一个围绕从第三人称视频中建模交互式 3D 对象的任务、数据集和基准框架。交互式对象是具象 AI 的高兴趣,但稀缺,这使得从可获得的真实世界视频中建模具有实际价值。我们的任务聚焦于从第三人称视频输入获取可用于仿真的交互式 3D 对象的表示。虽然先前工作主要关注关节运动,但我们通过函数模板捕获一般的跨部件功能映射(例如,灶台旋钮的旋转控制灶台火炉温度),这是一种结构化的计算表示。函数模板使精确评估成为可能,并可直接编译到仿真平台的可执行代码中。为实现全面基准测试,我们引入了包含 271 个第三人称视频的数据集,涵盖具有挑战性的真实世界交互,配有对应的 3D 几何、2D 和 3D 分段、关节运动和函数模板标注。为解决该任务,我们提出一个四阶段管道:2D 部件分段、重建、关节运动估计和函数模板推断。全面基准测试显示,针对现成方法而言,该任务具有挑战性,为未来工作指明了方向。
引用
@article{arxiv.2604.11038,
title = {EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates},
author = {Weikun Peng and Denys Iliash and Manolis Savva},
journal= {arXiv preprint arXiv:2604.11038},
year = {2026}
}
备注
Project website: https://3dlg-hcvc.github.io/EgoFun3D/