中文

奖励推断中的选择集设定错误

人工智能 2021-01-20 v1 人机交互

摘要

为在没有自然奖励信号的环境中运行的机器人指定奖励函数可能具有挑战性,而错误指定的奖励可能会激励退化或危险的行为。手动指定奖励函数的一个有前景的替代方案是让机器人从人类反馈(如演示或纠正)中推断奖励。为了解释这些反馈,机器人将人从某个选择集(如本可演示的可能轨迹集合或本可做出的可能纠正集合)中所做的选择视为近似最优。在这项工作中,我们提出选择集本身可能难以指定的观点,并分析了选择集设定错误:当机器人对人类选择其反馈时所依据的选择集合做出错误假设时会发生什么。我们提出了一类不同种类选择集设定错误的分类,并表明这些不同类别会导致推断出的奖励和由此产生的性能出现显著差异。虽然我们通常预期设定错误会带来损害,但我们发现某些类型的设定错误既无益也无害(在期望意义上)。然而,在其他情况下,设定错误可能极其有害,导致机器人相信与其本应相信的相反内容。我们希望我们的结果能够有助于更好地预测和应对现实世界奖励推断中设定错误的影响。

关键词

引用

@article{arxiv.2101.07691,
  title  = {Choice Set Misspecification in Reward Inference},
  author = {Rachel Freedman and Rohin Shah and Anca Dragan},
  journal= {arXiv preprint arXiv:2101.07691},
  year   = {2021}
}

备注

Presented at the IJCAI-PRICAI 2020 Workshop on Artificial Intelligence Safety