HumanVLA:面向物理人形机的视觉语言导向对象重排
机器人学
2024-11-14 v2
摘要
物理人-场景交互(HSI)在诸多应用中发挥着关键作用。然而,现有的 HSI 技术局限于特定的对象动力学和特权信息,这阻碍了更全面应用的开发。为解决这一限制,我们引入 HumanVLA 实现通过实际视觉和语言引导的通用对象重排。利用教师-学生框架开发 HumanVLA。首先使用目标条件强化学习和对抗运动先验训练状态基教师策略。随后通过行为克隆将其蒸馏到视觉-语言-动作模型中。我们提出了几个关键见解以促进大规模学习过程。为支持通过物理人形机进行通用对象重排,我们引入一种新颖的 Human-in-the-Room 数据集,涵盖各种重排任务。通过大量实验和分析,我们展示了所提出方法的有效性。
引用
@article{arxiv.2406.19972,
title = {HumanVLA: Towards Vision-Language Directed Object Rearrangement by Physical Humanoid},
author = {Xinyu Xu and Yizheng Zhang and Yong-Lu Li and Lei Han and Cewu Lu},
journal= {arXiv preprint arXiv:2406.19972},
year = {2024}
}
备注
NeurIPS 2024