中文

你有 Freestyle 吗?基于音频控制的富有表现力的人形机器人运动

机器人学 2026-01-06 v2

摘要

人类会本能地随声音舞动,但当前的人形机器人缺乏富有表现力的即兴能力,局限于预定义动作或稀疏指令。从音频生成动作再将其重定向到机器人依赖于显式运动重建,会导致级联误差、高延迟以及声学与驱动映射脱节。我们提出 RoboPerform,这是首个统一的音频到运动框架,能够直接从音频生成音乐驱动的舞蹈和语音驱动的协同语音手势。在“运动 = 内容 + 风格”的核心原则指导下,该框架将音频视为隐式风格信号,消除了对显式运动重建的需求。RoboPerform 集成了用于适应多样运动模式的 ResMoE 教师策略和用于注入音频风格的基于扩散的学生策略。这种无重定向设计确保了低延迟和高保真度。实验验证表明,RoboPerform 在物理合理性和音频对齐方面取得了有前景的结果,成功将机器人转变为能够对音频做出反应的响应式表演者。

关键词

引用

@article{arxiv.2512.23650,
  title  = {Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control},
  author = {Zhe Li and Cheng Chi and Yangyang Wei and Boan Zhu and Tao Huang and Zhenguo Sun and Yibo Peng and Pengwei Wang and Zhongyuan Wang and Fangzhou Liu and Chang Xu and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2512.23650},
  year   = {2026}
}