在岗学习:人机交互中的长期行为自适应
机器人学
2022-03-22 v1 人机交互
机器学习
摘要
在这项工作中,我们提出了一种框架,使部署在公共空间中长期运行的自主机器人能够从用户交互中在线调整自身行为。机器人行为规划嵌入在强化学习(RL)框架中,其目标是最大化交互过程中的整体用户参与度。我们使用上置信界值迭代(UCBVI)算法,该算法为实时交互中探索-利用权衡的管理提供了有益方式。一个端到端训练的参与度模型在策略执行期间实时生成奖励函数。我们在英国林肯的一个公共博物馆中测试了该方法,机器人作为游客的导游被部署。结果显示,经过几个月的探索后,机器人策略学会了更长时间地维持用户参与度,游览期间访问项目数量较初始静态策略增加22.8%,完成游览的概率增加30%。这项工作是朝向社交场景机器人应用长期行为自适应的重要一步。
引用
@article{arxiv.2203.10518,
title = {Learning on the Job: Long-Term Behavioural Adaptation in Human-Robot Interactions},
author = {Francesco Del Duchetto and Marc Hanheide},
journal= {arXiv preprint arXiv:2203.10518},
year = {2022}
}
备注
8 pages, 9 figures