面向 RL 训练机器人表达性用户控制的在线行为修改
机器人学
2024-09-02 v1 人工智能
摘要
强化学习(RL)是机器人学习任务的有效方法。然而,在典型的 RL 中,机器人部署后,终端用户几乎或完全无法控制机器人执行任务的方式。为了解决这一问题,我们引入了在线行为修改的概念,这是一种在机器人使用 RL 训练策略自主完成任务时,允许用户实时控制机器人行为特征的范式。为了展示这种以用户为中心的人机交互公式的价值,我们提出了一种基于行为多样性的算法——RL 动力学可调控制(ACORD),并在仿真和用户研究中展示了其对在线行为修改的适用性。在该用户研究(n=23)中,用户在机器人自主描绘形状时调整绘画风格。我们将 ACORD 与 RL 和共享自治(SA)进行了比较,结果表明 ACORD 提供了用户偏好的控制和表达水平,与 SA 相当,但具备 RL 的自主执行潜力和鲁棒性。
引用
@article{arxiv.2408.16776,
title = {Online Behavior Modification for Expressive User Control of RL-Trained Robots},
author = {Isaac Sheidlower and Mavis Murdock and Emma Bethel and Reuben M. Aronson and Elaine Schaertl Short},
journal= {arXiv preprint arXiv:2408.16776},
year = {2024}
}
备注
This work was published and presented at HRI 2024