中文

Being-M0.5:一个实时可控的视觉语言运动模型

计算机视觉与模式识别 2025-08-12 v1 机器学习

摘要

人类运动生成作为一种具有变革潜力的关键技术,正在成为实际应用的关键技术。然而,现有的视觉语言运动模型(VLMM)面临着显著限制,阻碍其实际部署。我们识别出可控性是一个主要瓶颈,表现为五个关键方面:对多样化人类命令的响应不足、姿态初始化能力有限、在长序列上的表现不佳、对未见情景的处理不足以及缺乏对单个身体部位的细粒度控制。为克服这些限制,我们提出了Being-M0.5,是首个实现多项运动生成任务最佳性能的实时可控VLMM。我们的方案基于HuMo100M,这是目前规模最大、最全面的人类运动数据集,包含超过500万个自采集运动序列、1亿多任务指令实例以及详细的部件级注释,填补了现有数据集在这一方面的关键空白。我们引入一种新颖的部件感知残差量化技术,用于运动标记化,使其在生成期间能够对单个身体部位实现精确、细粒度的控制。大量实验验证表明,Being-M0.5在多样化运动基准测试中表现卓越,而全面的效率分析也确认了其实时能力。我们的贡献包括设计见解和详细的计算分析,以指导未来开发实用运动生成器。我们相信HuMo100M和Being-M0.5将代表着在加速实际应用中采纳运动生成技术的重大进步。项目页面可在https://beingbeyond.github.io/Being-M0.5访问。

关键词

引用

@article{arxiv.2508.07863,
  title  = {Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model},
  author = {Bin Cao and Sipeng Zheng and Ye Wang and Lujie Xia and Qianshan Wei and Qin Jin and Jing Liu and Zongqing Lu},
  journal= {arXiv preprint arXiv:2508.07863},
  year   = {2025}
}

备注

16 pages