KETA:基于细粒度对齐的通过运动学短语实现文本到运动生成
计算机视觉与模式识别
2025-01-28 v1
摘要
运动合成在人工智能的 various 领域中发挥着重要作用。在各种运动生成条件中,文本能够详尽地描述运动细节且获取便捷,使得文本到运动(T2M)生成变得重要。当前主流的T2M技术主要利用扩散模型生成以文本提示为导引的运动,解决T2M任务的许多对多性问题。然而,现有的T2M方法面临着自然语言领域与物理领域之间的鸿沟,导致难以生成与文本完全一致的运动。我们利用运动学短语(KP),这是一种桥接这两种模态的中间表示,来解决此问题。我们提出的方法KETA通过语言模型将给定文本分解为多个子文本。它训练一个对齐器,将分解后的文本与从生成运动中提取的KP片段对齐。如此一来,便可限制扩散基于T2M模型的行为。在训练阶段,我们部署文本-KP对齐损失作为辅助目标来监督模型。在推理阶段,我们在解码器结构中对生成的运动进行多轮细化,计算每一轮的文本-KP距离作为导引信号。实验表明,KETA在基于基础模型的两个扩散模型背板上,R精确度和FID值分别提升了最高可达1.19倍和2.34倍。相较于广泛的T2M生成模型,KETA要么获得最佳性能,要么获得次佳性能。
引用
@article{arxiv.2501.15058,
title = {KETA: Kinematic-Phrases-Enhanced Text-to-Motion Generation via Fine-grained Alignment},
author = {Yu Jiang and Yixing Chen and Xingyang Li},
journal= {arXiv preprint arXiv:2501.15058},
year = {2025}
}
备注
7 pages, 5 figures