中文

以看促动:迈向视觉驱动的虚拟人运动生成

计算机视觉与模式识别 2025-09-24 v1

摘要

我们感知世界的方式从根本上塑造了我们移动的方式,无论是我们在房间里如何导航,还是我们如何与其他人类互动。当前的人类运动生成方法忽略了这种相互依赖关系,并使用与人类截然不同的特定任务“感知”。我们认为,类人虚拟人行为的生成需要类人的感知。因此,在这项工作中,我们提出了 CLOPS,这是第一个仅使用自我中心视觉来感知周围环境并进行导航的人类虚拟人。然而,将视觉作为运动的主要驱动力给训练虚拟人带来了一个重大挑战:现有数据集要么只有孤立的人类运动,而没有场景上下文,要么缺乏规模。我们通过将低层运动技能的学习与将视觉输入映射到运动的高层控制的学习解耦来克服这一挑战。首先,我们在大型运动捕捉数据集上训练一个运动先验模型。然后,使用 Q-learning 训练一个策略,将自我中心视觉输入映射为运动先验的高层控制命令。我们的实验凭经验证明,自我中心视觉可以在我们的虚拟人中产生类人的运动特征。例如,虚拟人行走时会避开存在于其视野中的障碍物。这些发现表明,为虚拟人配备类人传感器,特别是自我中心视觉,对于训练行为像人类的虚拟人具有广阔前景。

关键词

引用

@article{arxiv.2509.19259,
  title  = {Moving by Looking: Towards Vision-Driven Avatar Motion Generation},
  author = {Markos Diomataris and Berat Mert Albaba and Giorgio Becherini and Partha Ghosh and Omid Taheri and Michael J. Black},
  journal= {arXiv preprint arXiv:2509.19259},
  year   = {2025}
}