Generated Reality:使用手部和摄像机控制的交互式视频生成的人中心世界模拟
计算机视觉与模式识别
2026-02-23 v1
摘要
扩增现实(XR)需要能够响应用户跟踪的真实世界运动的生成模型,而当前的视频世界模型仅接受粗糙的控制信号,如文本或键盘输入,限制了其在具身交互中的实用性。我们引入一种以人为本的视频世界模型,条件化于跟踪的头部姿态和关节级手部姿态。为此,我们评估了现有的扩散变换器条件策略,并提出了有效的3D头部和手部控制机制,实现对手部-物体交互的灵巧操作。我们训练了一个使用该策略的双向视频扩散模型教师,并将其蒸馏到一个因果的、交互式系统,用于生成第三人称视角的虚拟环境。我们通过人类主体评估了该生成现实系统,证明其在任务性能和对所执行动作的控制感知程度方面均显著优于相关基线。
引用
@article{arxiv.2602.18422,
title = {Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control},
author = {Linxi Xie and Lisong C. Sun and Ashley Neall and Tong Wu and Shengqu Cai and Gordon Wetzstein},
journal= {arXiv preprint arXiv:2602.18422},
year = {2026}
}
备注
Project page here: https://codeysun.github.io/generated-reality