中文

意图驱动的第一人称到第三人称视频生成

计算机视觉与模式识别 2024-03-19 v2

摘要

第一人称到第三人称视频生成是指根据第一人称视频生成相应的第三人称视频,在AR/VR和具身人工智能中具有重要应用。受益于扩散模型技术的进步,视频生成取得了显著进展。然而,现有方法建立在相邻帧之间时空一致性假设的基础上,这在视角剧烈变化的第一人称到第三人称场景中无法满足。为此,本文提出了一种意图驱动的第一人称到第三人称视频生成框架(IDE),该框架利用由人体运动和动作描述组成的动作意图作为视角无关的表示来指导视频生成,从而保持内容和运动的一致性。具体来说,首先通过多视角立体匹配估计第一人称头部轨迹。然后,引入跨视角特征感知模块来建立第三人称视角与第一人称视角之间的对应关系,指导轨迹变换模块从头部轨迹推断人体全身运动。同时,我们提出了一个动作描述单元,将动作语义映射到与第三人称图像一致的特征空间。最后,推断出的人体运动和高层动作描述在扩散模型的反向过程中共同指导第三人称运动和交互内容(即相应的光流和遮挡图)的生成,最终将其变形为相应的第三人称视频。我们在包含多样化第一人称-第三人称视频对的相关数据集上进行了大量实验,我们的IDE在主观和客观评估中均优于最先进的模型,证明了其在第一人称到第三人称视频生成中的有效性。

关键词

引用

@article{arxiv.2403.09194,
  title  = {Intention-driven Ego-to-Exo Video Generation},
  author = {Hongchen Luo and Kai Zhu and Wei Zhai and Yang Cao},
  journal= {arXiv preprint arXiv:2403.09194},
  year   = {2024}
}