中文

离散到连续:从手势观察生成平滑过渡姿态

计算机视觉与模式识别 2024-11-27 v1

摘要

从离散片段生成连续手势视频具有诱人的挑战,因为需要保持自然流畅的过渡以保存意义。传统方法仅简单拼接孤立手势,常导致突兀的过渡,破坏视频的连贯性。为此,我们提出一种新框架Sign-D2C,采用条件扩散模型合成具备上下文导向的平滑过渡帧,实现连续手势序列的无缝构建。我们的做法通过随机掩码长时段手势视频中的片段来模拟过渡帧的缺失,将无监督的过渡帧生成问题转化为监督式训练任务。模型通过去噪高斯噪声、以周围手势观察为条件,学习预测这些被掩码的帧,从而能够处理复杂且非结构化的过渡。在推理阶段,我们应用线性插值填充策略,通过边界帧之间的插值初始化缺失帧,为扩散模型的迭代细化提供稳定基础。在PHOENIX14T、USTC-CSL100和USTC-SLR500数据集上进行的广泛实验表明,我们的方法在生成连续、自然的手势视频方面有效。

关键词

引用

@article{arxiv.2411.16810,
  title  = {Discrete to Continuous: Generating Smooth Transition Poses from Sign Language Observation},
  author = {Shengeng Tang and Jiayi He and Lechao Cheng and Jingjing Wu and Dan Guo and Richang Hong},
  journal= {arXiv preprint arXiv:2411.16810},
  year   = {2024}
}

备注

10 pages, 4 figures