AGILE:基于智能体生成的手-物体交互重建
计算机视觉与模式识别
2026-05-11 v3 图形学
机器人学
摘要
从单目视频重建动态手-物体交互对于机械臂数据收集和创建机器人和 VR 的真实数字孪生体至关重要。然而,当前方法面临两个不可逾越的障碍:(1)依赖神经渲染会导致遮挡严重时几何碎片化,无法用于仿真;(2)依赖脆弱的结构光运动(SfM)初始化导致在野生态视频上频繁失败。为克服这些限制,我们引入 AGILE 框架,构建从重建向智能体生成的交互学习范式。首先,我们采用智能体管道,其中视觉语言模型(VLM)引导生成模型合成完整、致密的物体网格,具备高保真纹理,独立于视频遮挡。其次,规避脆弱的 SfM,直接提出稳健的锚定-跟踪策略。我们利用基础模型在单个交互起始帧上初始化物体姿态,并通过利用我们生成资产与视频观察之间的强视觉相似性进行时序传递。最后,接触感优化集成语义、几何和交互稳定性约束,以确保物理可行性。在 HO3D、DexYCB、ARCTIC 和野生态视频上的大量实验表明,AGILE 在全局几何精度上优于基线方法,并在面临挑战的序列上展现出极佳鲁棒性,其中先前方法经常崩溃。通过优先考虑物理有效性,我们的方法产生经过验证的仿真就绪资产,可用于机器人应用的真实到仿真的重定向。项目页面:https://agile-hoi.github.io。
引用
@article{arxiv.2602.04672,
title = {AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation},
author = {Jin-Chuan Shi and Binhong Ye and Tao Liu and Xiaoyang Liu and Yangjinhui Xu and Junzhe He and Zeju Li and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2602.04672},
year = {2026}
}
备注
16 pages, SIGGRAPH 2026