我学到了什么:揭示奖励学习过程的提问方法
人机交互
2021-07-06 v1 机器人学
摘要
机器人可以通过提问向人类学习。在这些问题中,机器人展示几种不同的行为,并询问人类最喜欢哪一种。但机器人应如何选择要问的问题?当今的机器人会优化信息量丰富的问题,以尽可能高效地主动探查人类的偏好。但从机器人的视角看信息量丰富的问题固然合理,人类旁观者却常觉得它们随意且具误导性。本文从人类视角形式化了基于主动偏好的学习。我们假设——从人类的角度看——机器人的问题揭示了机器人已学到和未学到的内容。这一洞见使机器人能够利用问题使其学习过程对人类操作者透明。我们开发并测试了一个模型,机器人可借助该模型将所提问题与这些问题所揭示的信息联系起来。随后我们引入了信息量与揭示性问题之间的权衡,兼顾人类与机器人视角:优化该权衡的机器人能从人类处主动收集信息,同时让人类了解其已学到的内容。我们在仿真、在线调查和现场用户研究中评估了我们的方法。用户研究视频与结果见:https://youtu.be/tC6y_jHN7Vw。
引用
@article{arxiv.2107.01995,
title = {Here's What I've Learned: Asking Questions that Reveal Reward Learning},
author = {Soheil Habibian and Ananth Jonnavittula and Dylan P. Losey},
journal= {arXiv preprint arXiv:2107.01995},
year = {2021}
}