G2P-DDM:基于离散扩散模型从词序列生成手语姿态序列
计算机视觉与模式识别
2023-12-19 v3
摘要
手语生成(SLP)项目旨在将口语自动翻译为手语序列。我们的方法聚焦于将手语词(gloss)序列转换为其对应手语姿态(pose)序列(G2P)。本文通过将连续姿态空间生成问题转化为离散序列生成问题,为该任务提出了一种新颖解决方案。我们引入Pose-VQVAE框架,其结合变分自编码器(VAEs)与向量量化,为连续姿态序列生成离散潜表示。此外,我们提出G2P-DDM模型,一种面向变长离散序列数据的离散去噪扩散架构,以建模潜先验。为进一步提升离散空间中姿态序列生成的质量,我们提出CodeUnet模型以利用时空信息。最后,我们开发了一种启发式顺序聚类方法,用于预测对应词序列的姿态序列可变长度。我们的结果显示,在公开SLP评估基准上,我们的模型优于SOTA的G2P模型。更多生成结果请访问项目页:\textcolor{blue}{\url{https://slpdiffusier.github.io/g2p-ddm}}
引用
@article{arxiv.2208.09141,
title = {G2P-DDM: Generating Sign Pose Sequence from Gloss Sequence with Discrete Diffusion Model},
author = {Pan Xie and Qipeng Zhang and Taiyi Peng and Hao Tang and Yao Du and Zexian Li},
journal= {arXiv preprint arXiv:2208.09141},
year = {2023}
}
备注
Accepted by AAAI2024