中文

面向带人类教师的时序差分强化学习机器人系统的透明性

机器人学 2020-05-13 v1 人机交互

摘要

对自主且灵活的人机交互(HRI)的高需求意味着有必要在机器人控制中部署机器学习(ML)机制。事实上,强化学习(RL)等ML技术的使用使得机器人在学习过程中的行为对观察用户而言不透明。在本工作中,我们提出一种情感模型,以改善人机协作场景中RL任务的透明性。我们提出的架构以情感模型辅助RL算法,该模型既能接收人类反馈,又能基于学习过程展现情感响应。该模型完全基于时序差分(TD)误差。该架构在隔离实验室中以简单设置进行了测试。结果突显出,通过情感响应展示其内部状态足以使机器人对其人类教师透明。人们也更偏好与有响应的机器人交互,因为他们习惯于通过情感和社会信号理解其意图。

关键词

引用

@article{arxiv.2005.05926,
  title  = {Towards Transparency of TD-RL Robotic Systems with a Human Teacher},
  author = {Marco Matarese and Silvia Rossi and Alessandra Sciutti and Francesco Rea},
  journal= {arXiv preprint arXiv:2005.05926},
  year   = {2020}
}

备注

Presented at the 2020 Workshop on Assessing, Explaining, and Conveying Robot Proficiency for Human-Robot Teaming