学习潜在表征以与人类协同适应
机器人学
2023-08-22 v3 人工智能
机器学习
摘要
当机器人在家庭、道路或工厂中与人类交互时,人类的行为往往会因机器人而改变。非平稳的人类对机器人学习者构成挑战:机器人已学会的与原始人类协调的动作,在人类适应机器人之后可能会失效。本文中,我们引入一种算法形式,使机器人(即自我智能体)能够仅使用机器人的低级状态、动作和奖励,与动态人类(即其他智能体)协同适应。一个核心挑战是,人类不仅对机器人的行为做出反应,而且其反应方式不可避免地会随时间推移和在不同用户之间发生变化。为应对这一挑战,我们的见解是——机器人无需构建人类的精确模型,而是可以学习并推理关于人类策略和策略动态的高级表征。应用这一见解,我们开发了RILI:鲁棒影响潜在意图。RILI首先将低级机器人观测嵌入到对人类潜在策略和策略动态的预测中。接着,RILI利用这些预测来选择动作,在重复交互中影响自适应人类,使其趋向有利的高奖励行为。我们证明——给定RILI在从底层分布采样的用户中测量的性能——我们可以概率性地界定RILI在从同一分布采样的新人类中的预期性能。我们的模拟实验将RILI与最先进的表征学习和强化学习基线进行比较,并表明RILI能更好地学习与不完美、有噪声和时变的智能体协调。最后,我们进行了两项用户研究,其中RILI在捉人游戏和搭塔任务中与实际人类协同适应。在此查看我们用户研究的视频:https://youtu.be/WYGO5amDXbQ
引用
@article{arxiv.2212.09586,
title = {Learning Latent Representations to Co-Adapt to Humans},
author = {Sagar Parekh and Dylan P. Losey},
journal= {arXiv preprint arXiv:2212.09586},
year = {2023}
}