面向团队环境监测的子模目标学习
机器人学
2021-12-16 v1
摘要
本文研究著名的团队定向问题,其中一组机器人通过访问地点来收集奖励。通常假设奖励为机器人所知;然而,在环境监测或场景重建等应用中,奖励往往是主观的,且难以明确指定。我们提出一个框架,通过向用户展示备选解并由用户对这些备选解给出排序,来学习用户的未知偏好。我们考虑用户的两种情况:1)确定性用户,对备选解给出最优排序;2)噪声用户,依据未知概率分布给出最优排序。对于确定性用户,我们提出一个框架以最小化与最优解的最大偏差界,即后悔值。我们调整该方法以刻画噪声用户并最小化期望后悔值。最后,我们利用真实世界环境监测问题数据集,通过大量实验结果展示了学习用户偏好的重要性以及所提方法的性能。
引用
@article{arxiv.2112.08000,
title = {Learning Submodular Objectives for Team Environmental Monitoring},
author = {Nils Wilde and Armin Sadeghi and Stephen L. Smith},
journal= {arXiv preprint arXiv:2112.08000},
year = {2021}
}