带宽受限环境下基于共机器人视觉探索的主动奖励学习
机器人学
2021-03-30 v1 人工智能
摘要
我们提出了一种新颖的POMDP问题表述,用于必须在与人类操作员有限通信能力下自主决定前往何处采集新颖且具科学相关图像的机器人。由此表述我们推导了此类机器人的观测模型、奖励模型与通信策略的约束与设计原则,探索了处理极高维观测空间与相关训练数据稀缺的技术。我们引入了一种基于查询的新颖主动奖励学习策略,以帮助机器人在线最小化路径“遗憾”,并通过仿真评估其在自主视觉探索中的适用性。我们证明,在某些带宽受限环境中,这一新颖的基于遗憾的准则使机器人探索者每任务收集的奖励比次优准则多至多17%。
引用
@article{arxiv.2003.05016,
title = {Active Reward Learning for Co-Robotic Vision Based Exploration in Bandwidth Limited Environments},
author = {Stewart Jamieson and Jonathan P. How and Yogesh Girdhar},
journal= {arXiv preprint arXiv:2003.05016},
year = {2021}
}
备注
7 pages, 4 figures; accepted for presentation in IEEE Int. Conf. on Robotics and Automation, ICRA '20, Paris, France, June 2020