用于增强人类视频生成中前景与背景运动分离的技术
计算机视觉与模式识别
2024-05-29 v2 人工智能
摘要
近期的人类视频合成技术进步使得通过应用稳定扩散模型生成高质量视频成为可能。然而,现有方法主要集中于仅依据姿态信息动画化人类元素(前景),而将背景完全保持静止。与此相反,在真实高质量视频中,背景往往会随前景运动而动态调整,避免静态局促。我们引入一种技术,通过分离前景和背景的运动表示来同时学习两者的动态行为。人物通过基于姿态的运动进行动画化,以捕捉复杂动作。相反,对于背景,我们采用稀疏跟踪点来建模运动,从而反映前景活动与环境变化之间的自然相互作用。在训练于真实世界视频并采用这种创新运动表述方法后,我们的方法生成的视频在前景主体及其周围环境之间 exhibit 连贯运动。为进一步扩展视频生成至不积累误差的更长序列,我们采用按片段生成策略,在每一步引入全局特征。为确保这些片段之间的无缝连续性,我们巧妙地将生成片段的最后一帧与输入噪声相连,以生成后续片段,保持叙事流动。在连续生成过程中,我们将初始参考图像的特征表示注入网络,从而有效地限制可能出现的累积性颜色不一致。经验评估表明,我们的方法在生成前景动作与响应式背景动态之间的和谐相互作用方面优于先前方法。
引用
@article{arxiv.2405.16393,
title = {Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation},
author = {Jinlin Liu and Kai Yu and Mengyang Feng and Xiefan Guo and Miaomiao Cui},
journal= {arXiv preprint arXiv:2405.16393},
year = {2024}
}