中文

动态世界,动态人类:用于动态场景的虚拟人-场景交互运动生成

计算机视觉与模式识别 2026-01-28 v1

摘要

在现实世界中,场景正在持续发生动态变化。然而,现有的human-场景交互生成方法通常将场景视为静态,这与现实情况相符。灵感来源于世界模型,我们引入Dyn-HSI——首个针对dynamic human-场景交互的认知架构,赋予虚拟人类三大人类组件。(1)视觉(人类眼睛):我们为虚拟人类配备Dynamic Scene-Aware Navigation,不断感知周围环境的变化并适应性地预测下一个路标。(2)记忆(人类大脑):我们为虚拟人类配备Hierarchical Experience Memory,存储和更新在训练期间积累的经验数据。这使模型能够在推理时利用先验知识,以实现情境感知的运动原位,从而提升运动质量和泛化能力。(3)控制(人类身体):我们为虚拟人类配备Human-场景交互扩散模型,生成以多模态输入为条件的高保真交互运动。为评估在dynamic场景中的性能,我们将现有的静态human-场景交互数据集扩展以构建dynamic基准,Dyn-Scenes。我们进行大量定性和定量实验以验证Dyn-HSI,表明该方法在static和dynamic场景中均一致优于现有方法,生成高质量的human-场景交互运动。

关键词

引用

@article{arxiv.2601.19484,
  title  = {Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes},
  author = {Yin Wang and Zhiying Leng and Haitian Liu and Frederick W. B. Li and Mu Li and Xiaohui Liang},
  journal= {arXiv preprint arXiv:2601.19484},
  year   = {2026}
}