从外推修正中学习
机器人学
2019-03-12 v2
摘要
我们的目标是使机器人能从用户指导中学习代价函数。用户往往难以或无法提供完整示教,因此修正作为一种更简便的指导渠道而出现。然而,当机器人从修正而非示教中学习代价函数时,它们必须将少量信息——沿途一个路径点的改变——外推至轨迹的其余部分。我们将此外推问题表述为在线函数逼近,其揭示了机器人可根据用于逼近的函数空间以不同方式解释人意图的轨迹。我们的仿真结果与用户研究表明,使用具有非欧几里得范数的函数空间能更好地捕捉用户意图,尤其在环境不杂乱时。这进而可使机器人学习到更精确的代价函数,并改善用户对机器人的主观感知。
引用
@article{arxiv.1812.01225,
title = {Learning from Extrapolated Corrections},
author = {Jason Y. Zhang and Anca D. Dragan},
journal= {arXiv preprint arXiv:1812.01225},
year = {2019}
}