中文

SkillMimic-V2:从稀疏和噪声演示中学习鲁棒且可泛化的交互技能

机器学习 2025-05-06 v1 计算机视觉与模式识别

摘要

我们解决了基于交互演示的强化学习(RLID)中的一个根本性挑战:演示噪声和覆盖范围的局限性。虽然现有的数据收集方法提供了有价值的交互演示,但它们通常会产生稀疏、不连贯且充满噪声的轨迹,无法捕捉到可能的技能变化和转换的全部范围。我们的核心见解是,尽管演示存在噪声且稀疏,但存在无限多的物理上可行的轨迹,这些轨迹自然地桥接了已演示的技能或从其邻近状态中涌现,形成了一个连续的技能变化和转换空间。基于这一见解,我们提出了两种数据增强技术:一种缝合轨迹图(STG),用于发现演示技能之间的潜在转换;以及一种状态转换场(STF),为演示邻域内的任意状态建立独特的连接。为了利用增强数据实现有效的RLID,我们开发了一种用于动态课程生成的自适应轨迹采样(ATS)策略,以及一种用于记忆依赖技能学习的历史编码机制。我们的方法能够实现鲁棒的技能获取,其泛化能力远超参考演示。在多种交互任务上的大量实验表明,在收敛稳定性、泛化能力和恢复鲁棒性方面,我们的方法相较于最先进的方法有显著提升。

关键词

引用

@article{arxiv.2505.02094,
  title  = {SkillMimic-V2: Learning Robust and Generalizable Interaction Skills from Sparse and Noisy Demonstrations},
  author = {Runyi Yu and Yinhuai Wang and Qihan Zhao and Hok Wai Tsui and Jingbo Wang and Ping Tan and Qifeng Chen},
  journal= {arXiv preprint arXiv:2505.02094},
  year   = {2025}
}