中文

Hand2World:基于自由空间手势的自回归原发性交互生成

计算机视觉与模式识别 2026-02-16 v2

摘要

原发性交互世界模型是增强现实和具身 AI 中必不可少的要素,在这些场景中,视觉生成必须能够以低延迟、几何一致性和长期稳定性响应用户输入。我们研究了从单张场景图像通过自由空间手势进行的原发性交互生成,旨在合成手部进入场景、与物体交互并在头部运动下诱导合理世界动态的照片写实视频。这种设置引入了基本挑战,包括自由空间手势与接触式训练数据之间的分布迁移、单目视图中手部运动与相机运动的歧义,以及任意长度视频生成的需求。我们提出了 Hand2World,一个统一的自回归框架,通过基于投影 3D 手部网格的遮挡不变手部条件处理这些挑战,允许从场景上下文推断可见性和遮挡信息,而非编码在控制信号中。为稳定原发性视点变化,我们通过每个像素的 Pl"ucker 射线嵌入注入显式相机几何,将相机运动与手部运动解耦,防止背景漂移。我们进一步开发了一个完全自动的单目标注管道,并将双向扩散模型蒸馏到因果生成器中,实现任意长度合成。在三个原发性交互基准测试中进行实验,结果在感知质量和 3D 一致性方面显著提升,同时支持相机控制和长期交互式生成。

关键词

引用

@article{arxiv.2602.09600,
  title  = {Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures},
  author = {Yuxi Wang and Wenqi Ouyang and Tianyi Wei and Yi Dong and Zhiqi Shen and Xingang Pan},
  journal= {arXiv preprint arXiv:2602.09600},
  year   = {2026}
}