中文

姿态引导的细粒度手语视频生成

计算机视觉与模式识别 2024-09-26 v1

摘要

手语视频是传播和学习手语的重要媒介。然而,现有的大多数人体图像合成方法生成的手语图像存在细节失真、模糊或结构错误的问题。它们生成的手语视频帧时序一致性较差,存在前后帧闪烁和细节突变等异常现象。为了解决这些局限性,我们提出了一种新颖的姿态引导运动模型(PGMM),用于生成细粒度且运动一致的手语视频。首先,我们提出了一个新的粗粒度运动模块(CMM),通过光流形变完成特征变形,从而在不改变外观的情况下转移粗粒度结构的运动;其次,我们提出了一个新的姿态融合模块(PFM),引导 RGB 与姿态特征的模态融合,从而完成细粒度生成。最后,我们设计了一个新的度量指标——时序一致性差异(TCD),通过比较重建视频帧与目标视频前后帧之间的差异来定量评估视频的时序一致性程度。大量定性和定量实验表明,我们的方法在大多数基准测试中优于 state-of-the-art 方法,在细节和时序一致性上均有显著提升。

关键词

引用

@article{arxiv.2409.16709,
  title  = {Pose-Guided Fine-Grained Sign Language Video Generation},
  author = {Tongkai Shi and Lianyu Hu and Fanhua Shang and Jichao Feng and Peidong Liu and Wei Feng},
  journal= {arXiv preprint arXiv:2409.16709},
  year   = {2024}
}

备注

ECCV 2024