中文

利用基于深度学习的 keypoints 预测提升视频动作迁移应用的带宽效率

计算机视觉与模式识别 2024-03-19 v1 人工智能

摘要

我们提出了一种基于深度学习的新颖预测框架,旨在提升动作迁移赋能视频应用(如视频会议、虚拟现实游戏和患者健康监测的隐私保护)中的带宽缩减效果。为了建模复杂动作,我们使用了一阶运动模型,该模型利用学习到的 keypoints 及其局部仿射变换来表示动态对象。Keypoints 由自监督 keypoint 检测器提取,并按对应视频帧组织成时间序列。为了在源设备上实现较低帧率的传输,使用变分循环神经网络(VRNN)对 keypoints 进行预测。然后,使用光流估计器和生成器网络将预测的 keypoints 合成为视频帧。在三个不同的数据集上,我们展示了结合基于 keypoints 的表示与基于 VRNN 的预测进行视频动画和重构的有效性。对于实时应用,我们的结果表明,与现有的基于 keypoints 的视频动作迁移框架相比,所提架构在不显著降低视频质量的前提下,可实现高达 2 倍的额外带宽缩减。

关键词

引用

@article{arxiv.2403.11337,
  title  = {Enhancing Bandwidth Efficiency for Video Motion Transfer Applications using Deep Learning Based Keypoint Prediction},
  author = {Xue Bai and Tasmiah Haque and Sumit Mohan and Yuliang Cai and Byungheon Jeong and Adam Halasz and Srinjoy Das},
  journal= {arXiv preprint arXiv:2403.11337},
  year   = {2024}
}