中文

异构演示终身学习中的策略发现与混合

机器学习 2022-02-16 v1

摘要

从演示中学习(LfD)方法使用户能够通过演示期望行为来教导机器人新任务,从而实现了机器人的普及化使用。LfD 研究中的一个关键挑战是,由于不同的策略与偏好,用户往往为同一任务提供异构演示。因此,开发确保灵活性(机器人适应个性化策略)、效率(机器人实现样本高效适应)和可扩展性(机器人重用简洁策略集来表示大量行为)的 LfD 算法至关重要。本文提出一种新颖算法——动态多策略奖励蒸馏(DMSRD),它蒸馏异构演示间的共性知识,利用习得的策略构建混合策略,并通过从所有可用数据中学习持续改进。我们的个性化、联邦化且终身的 LfD 架构在两个连续控制问题上超越基准,策略回报平均提升 77%,对数似然平均提升 42%,同时具有更强的任务奖励相关性与更精确的策略奖励。

关键词

引用

@article{arxiv.2202.07014,
  title  = {Strategy Discovery and Mixture in Lifelong Learning from Heterogeneous Demonstration},
  author = {Sravan Jayanthi and Letian Chen and Matthew Gombolay},
  journal= {arXiv preprint arXiv:2202.07014},
  year   = {2022}
}

备注

Accepted at the AAAI-22 Workshop on Interactive Machine Learning (IML@AAAI'22)