时序差分学习辅助人工肢体控制中的人类决策
人工智能
2013-09-19 v1 机器学习
机器人学
摘要
在本工作中,我们探索利用强化学习 (RL) 辅助人类决策,将最先进的 RL 算法与假肢应用相结合。管理人机交互是一个范围广泛的问题,而在生物医学技术和康复医学领域,简化人机接口尤为重要。例如,控制人工肢体的截肢者通常需要在多种控制动作或操作模式之间快速切换以操作其设备。我们认为,通过学习预测用户的行为,人工肢体可以在人类的控制决策中发挥积极作用,从而减轻用户的负担。最近,我们展示了采用广义价值函数 (GVFs) 形式的 RL 可用于在用户做出明确控制选择之前准确检测其控制意图。在本工作中,我们探索使用时序差分学习和 GVF 来预测用户何时会在机器人手臂的不同运动功能之间切换控制影响。实验使用了一个由用户身体肌肉信号控制的多功能机器人手臂(类似于传统的人工肢体控制)。我们的方法能够实时获取并维持关于用户切换决策的预测。它还为用户提供了一种直观且无需奖励的方式来纠正或强化机器学习系统所做的决策。我们预期,当系统对其预测足够确定时,它可以开始接管用户的切换决策以简化控制,并可能减少完成任务所需的时间和精力。因此,这项初步研究提出了一种自然整合基于人类和基于机器的决策系统的方法。
引用
@article{arxiv.1309.4714,
title = {Temporal-Difference Learning to Assist Human Decision Making during the Control of an Artificial Limb},
author = {Ann L. Edwards and Alexandra Kearney and Michael Rory Dawson and Richard S. Sutton and Patrick M. Pilarski},
journal= {arXiv preprint arXiv:1309.4714},
year = {2013}
}
备注
5 pages, 4 figures, This version to appear at The 1st Multidisciplinary Conference on Reinforcement Learning and Decision Making, Princeton, NJ, USA, Oct. 25-27, 2013