基于无冗余时空融合的多粒度人体建模用于文本驱动动作生成
计算机视觉与模式识别
2025-05-21 v2
摘要
文本到动作生成处于多模态学习与计算机图形学的交叉点,并且正获得越来越多的关注,因为它可以简化游戏、动画、机器人和虚拟现实的内容创作。大多数现有方法以直接的方式堆叠空间和时间特征,这增加了冗余且仍然遗漏了细微的关节级线索。我们引入了 HiSTF Mamba,一个包含三个部分的框架:Dual-Spatial Mamba、Bi-Temporal Mamba 和一个动态时空融合模块 (DSFM)。Dual-Spatial 模块并行运行基于部分和全身的模型,捕捉整体协调性和细粒度的关节运动。Bi-Temporal 模块向前和向后扫描序列,以编码短期细节和长期依赖。DSFM 移除冗余的时间信息,提取互补线索,并将其与空间特征融合以构建更丰富的时空表示。在 HumanML3D 基准上的实验表明,HiSTF Mamba 在多项指标上表现良好,实现了高保真度以及文本与动作之间紧密的语义对齐。
引用
@article{arxiv.2503.06897,
title = {Multi-granular body modeling with Redundancy-Free Spatiotemporal Fusion for Text-Driven Motion Generation},
author = {Xingzu Zhan and Chen Xie and Honghang Chen and Haoran Sun and Xiaochun Mai},
journal= {arXiv preprint arXiv:2503.06897},
year = {2025}
}
备注
15pages,5figures,