面向次优演示中样本高效学徒学习的研究
机器人学
2021-10-12 v1 机器学习
摘要
从演示中学习(LfD)旨在通过让非机器人专家终端用户提供演示来教导机器人执行新任务,从而实现机器人技术的普及。然而,由于演示者通常为非专家,现代 LfD 技术无法产生远优于次优演示的策略。先前提出的框架 SSRR 已在从次优演示学习中取得成功,但其依赖于注入噪声的轨迹来推断理想化奖励函数。诸如噪声注入这类随机方法生成轨迹有两个关键缺陷:1)性能退化可能是随机的,取决于噪声是否作用于关键状态;2)噪声注入生成的轨迹次优性可能有限,因此无法准确表征次优性的全部范围。我们提出系统性自监督奖励回归 S3RR,以研究轨迹退化的系统性替代方案。我们进行了实证评估,发现 S3RR 能够相对于最先进的从次优演示学习框架学习到与真实奖励相当或更好的相关性。
引用
@article{arxiv.2110.04347,
title = {Towards Sample-efficient Apprenticeship Learning from Suboptimal Demonstration},
author = {Letian Chen and Rohan Paleja and Matthew Gombolay},
journal= {arXiv preprint arXiv:2110.04347},
year = {2021}
}
备注
Presented at AI-HRI symposium as part of AAAI-FSS 2021 (arXiv:2109.10836)