通过多模态技能在非平稳环境中实现单次模仿
人工智能
2024-02-14 v1
摘要
单次模仿旨在从单次演示中学习新任务,然而,由于非平稳环境固有的高度领域多样性,将其应用于复杂任务是一个具有挑战性的问题。为解决这一问题,我们探索了复杂任务的组合性,并提出了一种新颖的基于技能的模仿学习框架,能够实现单次模仿和零样本适应;针对复杂未见任务的单次演示,推断出语义技能序列,然后将序列中的每个技能转换为针对随时间变化的环境隐藏动力学优化的动作序列。具体而言,我们利用视觉 - 语言模型从离线视频数据集中学习语义技能集,其中每个技能都在视觉 - 语言嵌入空间中表示,并结合动力学推断采用元学习以实现零样本技能适应。我们在扩展的多阶段 Meta-world 任务的各种单次模仿场景中评估了我们的框架,结果显示,与其他基线相比,该框架在学习复杂任务、泛化至动力学变化以及扩展至不同演示条件和模态方面具有优越性。
引用
@article{arxiv.2402.08369,
title = {One-shot Imitation in a Non-Stationary Environment via Multi-Modal Skill},
author = {Sangwoo Shin and Daehee Lee and Minjong Yoo and Woo Kyung Kim and Honguk Woo},
journal= {arXiv preprint arXiv:2402.08369},
year = {2024}
}
备注
ICML-2023 Camera Ready Version