面向高效实时视频运动迁移的生成式时间序列建模
计算机视觉与模式识别
2025-12-12 v2 人工智能
摘要
运动迁移是一种合成视频的技术,通过将驱动视频的运动动力学传递到源图像上。本文提出了一种基于深度学习的框架,以实现实时视频运动迁移,这对于实现带宽效率的应用(如视频会议、远程健康监测、虚拟现实交互和基于视觉的异常检测)至关重要。该框架利用关键点,这些关键点作为运动在时间轴上的语义上有意义且紧凑的表示。为实现视频传输中的带宽节省,我们使用两种生成式时间序列模型 VRNN 和 GRU-NF 对关键点进行预测。预测得到的关键点通过基于光流的模块和生成器网络转换为逼真的视频帧,从而实现高效、低帧率的视频传输。根据应用需求,该框架可以生成确定性的未来序列,或对一组可能的未来进行采样。实验结果表明,VRNN 在需要稳定且准确的多步预测应用中实现了最佳的点预测保真度(最低 MAE),在更高不确定性、多模态情境下尤为具竞争力。这一成果通过引入带有过去上下文以捕捉不确定性和时序变化的循环条件随机潜变量实现。相比之下,GRU-NF 模型在保持高视觉质量的同时实现了更丰富的生成视频多样性。这通过学习关键点与其潜表示之间的可逆、精确似然映射实现,支持对多样且连贯的关键点序列进行丰富且可控的采样。我们的工作为下一代需要实时、带宽高效且语义可控视频生成的 AI 系统奠定了基础。
引用
@article{arxiv.2504.05537,
title = {Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling},
author = {Tasmiah Haque and Md. Asif Bin Syed and Byungheon Jeong and Xue Bai and Sumit Mohan and Somdyuti Paul and Imtiaz Ahmed and Srinjoy Das},
journal= {arXiv preprint arXiv:2504.05537},
year = {2025}
}