中文

UniSkill:通过跨本体技能表示模仿人类视频

机器人学 2025-09-23 v4 计算机视觉与模式识别

摘要

模仿是人类中一种基础学习机制,使个体能够通过观察和模仿专家来学习新任务。然而,将这一能力应用于机器人面临重大挑战,因为人类与机器人在视觉外观和物理能力方面存在根本差异。虽然已有方法通过包含共享场景和任务的跨本体数据集弥合这一差距,但在规模上收集此类人机对齐数据并不容易。本文提出 UniSkill—a 一套新型框架,从大规模无标签跨本体视频数据中学习本体无关技能表示,使从人类视频中提取的技能能够有效迁移到仅基于机器人数据训练的机器人策略中。我们的实验在仿真和真实环境中均表明,跨本体技能成功地指导机器人在未见过的视频提示下选择合适的动作。项目网址为:https://kimhanjung.github.io/UniSkill。

关键词

引用

@article{arxiv.2505.08787,
  title  = {UniSkill: Imitating Human Videos via Cross-Embodiment Skill Representations},
  author = {Hanjung Kim and Jaehyun Kang and Hyolim Kang and Meedeum Cho and Seon Joo Kim and Youngwoon Lee},
  journal= {arXiv preprint arXiv:2505.08787},
  year   = {2025}
}

备注

CoRL 2025. Project Page: https://kimhanjung.github.io/UniSkill/