中文

SegMo:面向细粒度文本-运动对齐的3D人体动作生成

计算机视觉与模式识别 2025-12-25 v1

摘要

从文本描述生成3D人体动作是具有广泛应用前景的研究问题,涉及视频游戏、虚拟现实和增强现实等领域。最近的方法仅在序列层面对文本描述与人体动作进行对齐,忽略了模态内部语义结构。然而,动作描述和动作序列都可以自然地分解为更小且语义连贯的片段,这些片段可作为原子对齐单元,以实现更细粒度的对应。鼓励我们提出SegMo,一个新的面向细粒度文本-运动对齐的人体Motion生成框架。我们的框架包含三个模块:(1)文本片段提取,将复杂的文本描述分解为按时间顺序排列的短语,每个短语代表一个简单的原子动作;(2)运动片段提取,将完整的动作序列划分为相应的运动片段;(3)细粒度文本-运动对齐,通过对比学习对文本和运动片段进行对齐。广泛的实验表明,SegMo在两个广泛使用的数据集上均优于强基准,在HumanML3D测试集上实现了0.553的改进TOP 1分数。此外,由于学习到的文本和运动片段共享嵌入空间,SegMo还可应用于检索式任务,如动作定位和动作到文本检索。

关键词

引用

@article{arxiv.2512.21237,
  title  = {SegMo: Segment-aligned Text to 3D Human Motion Generation},
  author = {Bowen Dang and Lin Wu and Xiaohang Yang and Zheng Yuan and Zhixiang Chen},
  journal= {arXiv preprint arXiv:2512.21237},
  year   = {2025}
}

备注

The IEEE/CVF Winter Conference on Applications of Computer Vision 2026