基于深度强化学习的共享自治
机器学习
2018-05-24 v2 人机交互
机器人学
摘要
在共享自治中,用户输入与半自治控制相结合以达成共同目标。该目标往往事先未知,因此先前工作使智能体能够从用户输入推断目标并协助完成任务。此类方法往往假定对环境动力学、给定目标下用户策略以及用户可能指向的目标集合有所了解,这限制了其在真实场景中的应用。我们提出一种无模型的共享自治深度强化学习框架,解除了这些假设。我们使用带神经网络函数近似的人在回路强化学习,学习从环境观测与用户输入到智能体动作值的端到端映射,仅以任务奖励作为唯一监督形式。该方法带来如下挑战:既要足够紧密地遵循用户指令以为用户提供实时动作反馈从而保证高质量用户输入,又要在用户动作次优时偏离之。我们通过丢弃值低于某阈值的动作,再从中选取最接近用户输入的剩余动作来平衡这两方面需求。包含用户(n = 12)与合成飞行员游玩视频游戏的受控研究,以及用户(n = 4)操控真实四旋翼飞行器的初步研究,证明了我们的算法在实时控制任务中协助用户的能力——其中智能体无法通过观测直接访问用户的私有信息,但接收依赖于用户意图的奖励信号与用户输入。智能体在无法访问该私有信息的情况下学习协助用户,从用户输入中隐式推断之。本文为概念验证,展示了深度强化学习实现灵活实用辅助系统的潜力。
引用
@article{arxiv.1802.01744,
title = {Shared Autonomy via Deep Reinforcement Learning},
author = {Siddharth Reddy and Anca D. Dragan and Sergey Levine},
journal= {arXiv preprint arXiv:1802.01744},
year = {2018}
}
备注
Accepted to the Robotics: Science and Systems (RSS) 2018 conference