SnapMoGen:从情感文本生成人体动作
计算机视觉与模式识别
2025-10-24 v2
摘要
文本到动作生成近年来取得了显著进展。然而,当前方法仍受限于从短文本或通用文本提示生成动作,主要due于数据集限制。这种限制削弱了细粒度控制和对未见文本提示的泛化能力。本文我们引入 SnapMoGen,一个新的文本-动作数据集,包含高质量的动作捕捉数据与准确、情感丰富的文本注释。该数据集包含 20K 条动作剪辑,总时长为 44 小时,伴随 122K 条详细文本描述,平均每条描述 48 个词(与 HumanML3D 的 12 个词相比较)。重要的是,这些动作剪辑保留了原始的时间连续性,因为它们来自长序列,促进了长期动作生成和混合研究。我们还改进了之前的生成式掩码建模方法。我们的模型 MoMask++ 将动作转换为多尺度 token 序列,以更好地利用 token 容量,并学习使用单一生成式掩码变换器生成所有 token。MoMask++ 在 HumanML3D 和 SnapMoGen 基准测试中实现了最先进的性能。此外,我们演示了通过使用 LLM 来重新格式化输入,以与 SnapMoGen 的表达性和叙事风格保持一致,从而处理非正式用户提示。项目网页:https://snap-research.github.io/SnapMoGen/
引用
@article{arxiv.2507.09122,
title = {SnapMoGen: Human Motion Generation from Expressive Texts},
author = {Chuan Guo and Inwoo Hwang and Jian Wang and Bing Zhou},
journal= {arXiv preprint arXiv:2507.09122},
year = {2025}
}
备注
Project Webpage: https://snap-research.github.io/SnapMoGen/