T2LM:基于多句子的长期三维人体运动生成
计算机视觉与模式识别
2024-06-04 v1
摘要
在本文中,我们解决了长期三维人体运动生成的挑战性问题。具体来说,我们的目标是从多个句子(即段落)的流中生成一个平滑连接的长时间动作序列。先前的长期运动生成方法大多基于循环方法,使用先前生成的运动块作为下一步的输入。然而,这种方法有两个缺点:1)它依赖于顺序数据集,这很昂贵;2)这些方法在每一步生成的运动之间会产生不真实的间隙。为了解决这些问题,我们引入了简单而有效的T2LM,一个可以在没有顺序数据的情况下训练的连续长期生成框架。T2LM包含两个组件:一个一维卷积VQVAE,训练用于将运动压缩为潜在向量序列;以及一个基于Transformer的文本编码器,用于根据输入文本预测潜在序列。在推理时,一个句子序列被翻译成一个连续的潜在向量流。然后由VQVAE解码器将其解码为运动;使用具有局部时间感受野的一维卷积避免了训练序列和生成序列之间的时间不一致性。这种对VQ-VAE的简单约束使其仅用短序列即可训练,并产生更平滑的过渡。T2LM优于先前的长期生成模型,同时克服了对顺序数据的需求;它也与最先进的单动作生成模型具有竞争力。
引用
@article{arxiv.2406.00636,
title = {T2LM: Long-Term 3D Human Motion Generation from Multiple Sentences},
author = {Taeryung Lee and Fabien Baradel and Thomas Lucas and Kyoung Mu Lee and Gregory Rogez},
journal= {arXiv preprint arXiv:2406.00636},
year = {2024}
}
备注
CVPR 2024 HuMoGen Workshop