基于遮挡感知稀疏 3D 手关节的可控三人称视频生成
计算机视觉与模式识别
2026-04-13 v1
摘要
运动可控视频生成对于虚拟现实和具身 AI 的三人称应用至关重要。然而,现有方法常常难以实现 3D 一致的细粒度手部关节 articulation。通过采用 2D 轨迹或隐式姿态,这些方法将 3D 几何折叠为空间模糊信号,或过度依赖 human-centric 先验。在严重的三人称遮挡下,这会导致运动不一致和幻觉迹象,并阻止对机器人手部的跨 embodiment 泛化。为解决这些限制,我们提出一种新框架,从单个参考帧生成三人称视频,利用稀疏 3D 手关节作为 embodiment-agnostic 控制信号,具有清晰的语义和几何结构。我们引入一个高效控制模块,在 fully 保留 3D 信息的同时解决遮挡歧义。具体而言,它通过惩罚隐藏关节不可靠视觉信号来从源参考帧中提取遮挡感知特征,并采用 3D 加权机制在运动传播期间稳健处理动态遮挡目标关节。同时,该模块直接将 3D 几何嵌入到潜在空间,以严格强制结构一致性。为 facilitate 稳健训练和评估,我们开发了一个自动标注管道,产生超过一百万个高质量的三人称视频剪辑,配有精确的手部轨迹。此外,我们注册 humanoid 运动学和摄像机数据以构建跨 embodiment benchmark。大量实验表明,我们的方法显著优于 state-of-the-art 基准,生成高保真的三人称视频,具有真实的交互,并在对机器人手部实现卓越的跨 embodiment 泛化。
引用
@article{arxiv.2603.11755,
title = {Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints},
author = {Chenyangguang Zhang and Botao Ye and Boqi Chen and Alexandros Delitzas and Fangjinhua Wang and Marc Pollefeys and Xi Wang},
journal= {arXiv preprint arXiv:2603.11755},
year = {2026}
}