异构演示终身学习中的策略发现与混合
机器学习
2022-02-16 v1
摘要
从演示中学习(LfD)方法使用户能够通过演示期望行为来教导机器人新任务,从而实现了机器人的普及化使用。LfD 研究中的一个关键挑战是,由于不同的策略与偏好,用户往往为同一任务提供异构演示。因此,开发确保灵活性(机器人适应个性化策略)、效率(机器人实现样本高效适应)和可扩展性(机器人重用简洁策略集来表示大量行为)的 LfD 算法至关重要。本文提出一种新颖算法——动态多策略奖励蒸馏(DMSRD),它蒸馏异构演示间的共性知识,利用习得的策略构建混合策略,并通过从所有可用数据中学习持续改进。我们的个性化、联邦化且终身的 LfD 架构在两个连续控制问题上超越基准,策略回报平均提升 77%,对数似然平均提升 42%,同时具有更强的任务奖励相关性与更精确的策略奖励。
引用
@article{arxiv.2202.07014,
title = {Strategy Discovery and Mixture in Lifelong Learning from Heterogeneous Demonstration},
author = {Sravan Jayanthi and Letian Chen and Matthew Gombolay},
journal= {arXiv preprint arXiv:2202.07014},
year = {2022}
}
备注
Accepted at the AAAI-22 Workshop on Interactive Machine Learning (IML@AAAI'22)