中文

T2S-GPT:用于从文本生成手语的动态向量量化

计算机视觉与模式识别 2024-06-12 v1 人工智能

摘要

本文提出了一种两阶段手语生产(SLP)范例,首先将手语序列编码为离散代码,然后基于学习的代码表从文本中自回归生成手语。然而,现有的向量量化(VQ)方法是固定长度编码,忽略了手语中信息密度的不均匀性,导致重要区域的编码不足、不重要区域的编码过度。为此,我们提出了一种 novel 动态向量量化(DVA-VAE)模型,可根据手语中的信息密度动态调整编码长度,以实现准确且紧凑的编码。随后,一个类 GPT 的模型学习从口语文本生成代码序列及其对应的持续时间。在 PHOENIX14T 数据集上进行的大量实验表明,我们所提出方法的有效性。为促进手语研究,我们提出了一个新的大型德语手语数据集 PHOENIX-News,其中包含 486 小时的手语视频、音频和转录文本。在 PHOENIX-News 上的实验分析表明,通过增加训练数据的规模,可进一步提高本模型的性能。我们的项目主页为 https://t2sgpt-demo.yinaoxiong.cn。

关键词

引用

@article{arxiv.2406.07119,
  title  = {T2S-GPT: Dynamic Vector Quantization for Autoregressive Sign Language Production from Text},
  author = {Aoxiong Yin and Haoyuan Li and Kai Shen and Siliang Tang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2406.07119},
  year   = {2024}
}

备注

Accepted by ACL 2024