StROL:来自人类的稳定鲁棒在线学习
机器人学
2024-01-05 v2
摘要
机器人往往需要在当前交互过程中在线学习人类的奖励函数。这种实时学习要求快速但近似的学习规则:当人类行为含噪声或次优时,当前的近似会导致机器人学习不稳定。据此,本文旨在增强推断人类奖励参数时梯度下降学习规则的鲁棒性与收敛特性。我们将机器人的学习算法建模为关于人类偏好参数的动力系统,其中人类真实(但未知)偏好为平衡点。这使我们能执行李雅普诺夫稳定性分析,以推导机器人学习动态收敛的条件。我们提出的算法(StROL)利用这些条件学习按设计即鲁棒的学习规则:给定原始学习动态,StROL输出一个经修正的学习规则,该规则如今能在更大范围的人类输入下收敛至人类真实参数。在实践中,这些自主生成的学习规则能正确推断人类试图传达的信息,即便人类含噪声、有偏且次优。通过仿真与用户研究,我们发现StROL比最先进的在线奖励学习方法能获得更准确的估计与更少的遗憾。视频与代码见:https://github.com/VT-Collab/StROL_RAL
引用
@article{arxiv.2308.09863,
title = {StROL: Stabilized and Robust Online Learning from Humans},
author = {Shaunak A. Mehta and Forrest Meng and Andrea Bajcsy and Dylan P. Losey},
journal= {arXiv preprint arXiv:2308.09863},
year = {2024}
}