中文

SemanticBoost:以增强文本线索提升运动生成

计算机视觉与模式识别 2023-11-29 v2 人工智能 图形学 人机交互

摘要

当前技术难以从复杂语义描述生成运动,主要由于数据集中语义标注不足以及上下文理解能力弱。为解决这些问题,我们提出SemanticBoost,一种同时应对上述两个挑战的新框架。我们的框架由语义增强模块和上下文调适运动去噪器(CAMD)组成。语义增强模块从运动数据中提取补充语义,丰富数据集的文本描述,并确保文本与运动数据之间的精确对齐,而不依赖于大语言模型。另一方面,CAMD方法通过有效捕获上下文信息并将生成的运动与给定文本描述对齐,提供了一种生成高质量、语义一致运动序列的整体解决方案。与现有方法不同,我们的方法能够合成准确的方向性动作、基于特定身体部位描述的组合动作,以及由复杂长句生成的运动。我们的实验结果表明,作为一种基于扩散的方法,SemanticBoost优于基于自回归的技术,在Humanml3D数据集上取得了前沿性能,同时保持了逼真且平滑的运动生成质量。

关键词

引用

@article{arxiv.2310.20323,
  title  = {SemanticBoost: Elevating Motion Generation with Augmented Textual Cues},
  author = {Xin He and Shaoli Huang and Xiaohang Zhan and Chao Weng and Ying Shan},
  journal= {arXiv preprint arXiv:2310.20323},
  year   = {2023}
}