面向时序一致性的文本到运动生成
计算机视觉与模式识别
2026-03-11 v1
摘要
文本到运动(T2M)生成旨在从自然语言描述中综合真实的人类动作序列。虽然利用离散运动表示的两阶段框架已推动T2M研究的发展,但这些方法往往忽视跨序列时序一致性,即同一动作不同实例之间存在的共享时序结构。这导致语义错位和物理上不合理的运动。为解决此限制,我们提出TCA-T2M,一个面向时序一致性的T2M生成框架。我们的方法引入时序一致性感知的空间VQ-VAE(TCaS-VQ-VAE),用于实现跨序列时序对齐,同时配合基于掩码的运动变换器进行文本条件运动生成。此外,一个运动学约束模块可消除离散化伪影,确保物理可行性。在HumanML3D和KIT-ML基准测试上进行实验表明,TCA-T2M实现了最先进的性能,凸显了在稳健且连贯的T2M生成中保持时序一致性的重要性。
引用
@article{arxiv.2602.18057,
title = {Temporal Consistency-Aware Text-to-Motion Generation},
author = {Hongsong Wang and Wenjing Yan and Qiuxia Lai and Xin Geng},
journal= {arXiv preprint arXiv:2602.18057},
year = {2026}
}
备注
Code is on https://github.com/Giat995/TCA-T2M/