中文

通过想象动作修改强化学习策略:可预测策略如何使用户执行新任务

机器人学 2023-12-12 v1 人工智能 人机交互

摘要

用户能够利用机器人的功能创造性地即时解决问题至关重要。使用基于强化学习(RL)的机器人的用户可能希望利用机器人的自主性和对其行为的了解来完成新任务。一种方法是用户通过遥操作控制机器人部分动作空间,同时 RL 策略控制其余部分。然而,现成的 RL 策略可能不容易实现这一点。例如,用户的控制可能使机器人进入策略视角下的失败状态,导致其以用户不熟悉的方式行动,阻碍用户期望任务的成功。本文形式化了这个问题,并提出了想象域外动作(IODA),一种解决该问题的初始算法,使用户能够利用他们对机器人行为的期望来完成新任务。

关键词

引用

@article{arxiv.2312.05991,
  title  = {Modifying RL Policies with Imagined Actions: How Predictable Policies Can Enable Users to Perform Novel Tasks},
  author = {Isaac Sheidlower and Reuben Aronson and Elaine Short},
  journal= {arXiv preprint arXiv:2312.05991},
  year   = {2023}
}

备注

Pre-print to be published in the AAAI Fall Symposium 2023 Proceedings (part of the AI-HRI Symposium)