OpenT2M:基于开源、大规模、高质量数据的无需额外设计的运动生成
计算机视觉与模式识别
2026-03-20 v1 人工智能
摘要
文本到运动(Text-to-motion,T2M)生成旨在从文本描述中创建逼真的人类动作,已展现出在动画和机器人领域的广泛应用前景。尽管近期取得的进展令人鼓舞,但现有T2M模型在处理未见过的文本描述时表现不佳,这源于现有运动数据集规模小且多样性有限。为此,我们引入OpenT2M,一个规模达数十万小时、高质量且开源的运动数据集,包含超过2800小时的人类运动。每个运动序列都经过严格的质量控制,包括物理可行性验证和多层次过滤,并配有细粒度的秒级文本标注。我们还开发了一个用于创建长时程序列的自动化管道,支持复杂运动的生成。基于OpenT2M,我们提出MonoFrill,一个预训练的运动模型,无需复杂的设计或技巧“装饰”,即可实现出色的T2M效果。其核心组件是2D-PRQ——一种新颖的运动标记器,通过将人体划分为生物学部位来捕捉时空依赖关系。实验表明,OpenT2M显著提升了现有T2M模型的泛化能力,而2D-PRQ在重建和零样性能上均表现优异。我们期望OpenT2M和MonoFrill将推动T2M领域的发展,解决长期以来的数据质量和基准测试挑战。
引用
@article{arxiv.2603.18623,
title = {OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data},
author = {Bin Cao and Sipeng Zheng and Hao Luo and Boyuan Li and Jing Liu and Zongqing Lu},
journal= {arXiv preprint arXiv:2603.18623},
year = {2026}
}