HDMI:从人类视频中学习交互式人形机器人全身控制
机器人学
2025-09-30 v3
摘要
由于运动数据稀缺和接触密集的特性,实现鲁棒的全身人形机器人-物体交互(HOI)仍然具有挑战性。我们提出了 HDMI(HumanoiD iMitation for Interaction),这是一个简单且通用的框架,可直接从单目 RGB 视频中学习全身人形机器人-物体交互技能。我们的流程包括:(i) 从无约束视频中提取并重定向人类和物体轨迹,以构建结构化的运动数据集;(ii) 训练一个强化学习(RL)策略,通过三个关键设计来协同跟踪机器人和物体状态:统一的物体表示、残差动作空间和通用的交互奖励;(iii) 将 RL 策略零样本部署到真实人形机器人上。在 Unitree G1 人形机器人上进行的大量仿真到现实实验证明了我们方法的鲁棒性和通用性:HDMI 实现了 67 次连续穿门,并在现实世界中成功执行了 6 种不同的移动操作任务,在仿真中执行了 14 种任务。我们的结果确立了 HDMI 作为一个从人类视频中获取交互式人形机器人技能的简单且通用的框架。
引用
@article{arxiv.2509.16757,
title = {HDMI: Learning Interactive Humanoid Whole-Body Control from Human Videos},
author = {Haoyang Weng and Yitang Li and Nikhil Sobanbabu and Zihan Wang and Zhengyi Luo and Tairan He and Deva Ramanan and Guanya Shi},
journal= {arXiv preprint arXiv:2509.16757},
year = {2025}
}
备注
website: hdmi-humanoid.github.io