中文

基于潜在表示偏差的自监督学习用于共说话手势视频生成

计算机视觉与模式识别 2024-09-27 v1

摘要

手势在增强语音沟通方面起着关键作用。虽然最近的工作大多关注点级运动转换或通过数据驱动方法实现完全监督的运动表示,但我们聚焦于共说话手势的表示,特别是自监督表示和像素级运动偏差,利用包含潜在运动特征的扩散模型。我们的方法利用潜在表示中的自监督偏差来促进手部手势的生成,这些手势对于生成真实的手势视频至关重要。我们第一实验的结果表明,我们的方法提高了生成视频的质量,FGD、DIV 和 FVD 提升了 2.7%至 4.5%,PSNR 提升了 8.1%,SSIM 提升了 2.5%。

关键词

引用

@article{arxiv.2409.17674,
  title  = {Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation},
  author = {Huan Yang and Jiahui Chen and Chaofan Ding and Runhua Shi and Siyu Xiong and Qingqi Hong and Xiaoqi Mo and Xinhan Di},
  journal= {arXiv preprint arXiv:2409.17674},
  year   = {2024}
}

备注

5 pages, 5 figures, conference