中文

在部分可观测域中学习应提供何种信息

人工智能 2018-10-01 v4 机器人学

摘要

在许多机器人应用中,自主智能体必须在其人类队友未观测到的部分可观测环境中行动与探索。我们考虑这样一种设定:智能体在行动时可向人类传递陈述性信息,以帮助其理解这一未观测环境的各个方面。本工作中,我们解决智能体应如何规划采取何种行动以及传递何种信息的算法问题。自然地,人们会预期人类具有偏好,我们从信息论角度建模该偏好,依据所传递信息引起的对人类信念状态加权熵的改变来对其评分。我们将此设定表述为一个信念 MDP,并给出一种可近似求解的易处理算法。随后,我们给出一种允许智能体通过探索在线学习人类偏好的算法。我们在模拟的离散与连续部分可观测搜索与救援域中通过实验验证了我们的方法。访问 http://tinyurl.com/chitnis-corl-18 观看补充视频。

关键词

引用

@article{arxiv.1805.08263,
  title  = {Learning What Information to Give in Partially Observed Domains},
  author = {Rohan Chitnis and Leslie Pack Kaelbling and Tomás Lozano-Pérez},
  journal= {arXiv preprint arXiv:1805.08263},
  year   = {2018}
}

备注

CoRL 2018 final version