从人-人演示中学习全身人-人形机器人交互
机器人学
2026-01-15 v1 人工智能
计算机视觉与模式识别
摘要
使人形机器人能够与人类进行物理交互是一个关键的前沿领域,但进展受到高质量人-人形机器人交互(HHoI)数据稀缺的阻碍。虽然利用丰富的人-人交互(HHI)数据提供了一种可扩展的替代方案,但我们首先证明,标准的重定向方法会因破坏必要的接触而失败。我们通过PAIR(物理感知交互重定向)来解决这个问题,这是一个以接触为中心的两阶段流程,它保留了跨形态差异的接触语义,以生成物理上一致的HHoI数据。然而,这些高质量数据暴露了第二个失败点:传统的模仿学习策略仅仅模仿轨迹,缺乏交互理解。因此,我们引入了D-STAR(解耦时空动作推理器),这是一种分层策略,它将何时行动与何处行动解耦。在D-STAR中,相位注意力(何时)和多尺度空间模块(何处)由扩散头融合,以产生超越模仿的同步全身行为。通过解耦这些推理流,我们的模型能够学习鲁棒的时间相位,而不会被空间噪声干扰,从而实现响应式、同步的协作。我们通过广泛而严格的仿真验证了我们的框架,证明了其相对于基线方法的显著性能提升,并展示了一个从HHI数据学习复杂全身交互的完整、有效的流水线。
引用
@article{arxiv.2601.09518,
title = {Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations},
author = {Wei-Jin Huang and Yue-Yi Zhang and Yi-Lin Wei and Zhi-Wei Xia and Juantao Tan and Yuan-Ming Li and Zhilin Zhao and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2601.09518},
year = {2026}
}