中文

基于语义奖励操控的一次性策略诱导

机器人学 2021-01-07 v1 人工智能 多智能体系统

摘要

同步关于世界状态的期望与知识是有效协作的一项基本能力。为使机器人能与人类及其他自主智能体有效协作,关键在于其能够生成可理解的解释,以调和自身对世界的理解与协作者之间的分歧。本工作中,我们提出用于增强奖励的单次策略解释(SPEAR),一种新颖的序贯优化算法,其利用由规划谓词组合导出的语义解释来增强智能体的奖励函数,从而驱动其策略展现出更优的行为。我们在两个具有实际背景的应用中对该算法的策略操控能力进行了实验验证,并以 SPEAR 在状态空间与谓词数量渐趋复杂的域上的性能分析作结。我们证明,相较最先进水平(SOTA),我们的方法在运行时间与可处理问题规模上均有实质性改进,使智能体能够利用其自身专长传达可操作信息以提升他者表现。

关键词

引用

@article{arxiv.2101.01860,
  title  = {One-shot Policy Elicitation via Semantic Reward Manipulation},
  author = {Aaquib Tabrez and Ryan Leonard and Bradley Hayes},
  journal= {arXiv preprint arXiv:2101.01860},
  year   = {2021}
}

备注

17 pages, 7 figures