中文

CASIM:用于文本到运动生成的复合感知语义注入

计算机视觉与模式识别 2025-02-05 v1 人工智能 图形学

摘要

近期生成模型和标记化技术的进展推动了文本到运动生成领域取得了显著进展,提升了生成运动的质量和真实性。然而,有效地利用文本信息进行条件运动生成仍是一个开放挑战。我们观察到,当前方法主要依赖固定长度的文本嵌入(如 CLIP)进行全局语义注入,难以捕捉人类运动的复合特性,导致运动质量和可控性次优。为此,我们提出了复合感知语义注入机制(Composite Aware Semantic Injection Mechanism, CASIM),包括复合感知语义编码器和文本-运动对齐器,后者学习文本和运动标记之间的动态对应关系。值得注意的是,CASIM 对模型和表示方式不敏感,能够轻松集成到基于自回归和扩散方法中。在 HumanML3D 和 KIT 数据集上的实验表明,CASIM 在运动质量、文本-运动对齐和检索得分方面均稳居上风。定性分析进一步凸显了复合感知方法优于固定长度语义注入的优势,使其能够从文本提示实现精确运动控制,并对未见文本输入具备更强的泛化能力。

关键词

引用

@article{arxiv.2502.02063,
  title  = {CASIM: Composite Aware Semantic Injection for Text to Motion Generation},
  author = {Che-Jui Chang and Qingze Tony Liu and Honglu Zhou and Vladimir Pavlovic and Mubbasir Kapadia},
  journal= {arXiv preprint arXiv:2502.02063},
  year   = {2025}
}