SemanticBoost:以增强文本线索提升运动生成
计算机视觉与模式识别
2023-11-29 v2 人工智能
图形学
人机交互
摘要
当前技术难以从复杂语义描述生成运动,主要由于数据集中语义标注不足以及上下文理解能力弱。为解决这些问题,我们提出SemanticBoost,一种同时应对上述两个挑战的新框架。我们的框架由语义增强模块和上下文调适运动去噪器(CAMD)组成。语义增强模块从运动数据中提取补充语义,丰富数据集的文本描述,并确保文本与运动数据之间的精确对齐,而不依赖于大语言模型。另一方面,CAMD方法通过有效捕获上下文信息并将生成的运动与给定文本描述对齐,提供了一种生成高质量、语义一致运动序列的整体解决方案。与现有方法不同,我们的方法能够合成准确的方向性动作、基于特定身体部位描述的组合动作,以及由复杂长句生成的运动。我们的实验结果表明,作为一种基于扩散的方法,SemanticBoost优于基于自回归的技术,在Humanml3D数据集上取得了前沿性能,同时保持了逼真且平滑的运动生成质量。
引用
@article{arxiv.2310.20323,
title = {SemanticBoost: Elevating Motion Generation with Augmented Textual Cues},
author = {Xin He and Shaoli Huang and Xiaohang Zhan and Chao Weng and Ying Shan},
journal= {arXiv preprint arXiv:2310.20323},
year = {2023}
}