中文

重新审视用于高层机器人解释的奖励分解

机器学习 2023-11-07 v2 人工智能 机器人学

摘要

向人类解释由强化学习(RL)智能体习得的行为具有挑战性却至关重要,原因在于其不可理解的自体感知状态、可变的中间目标及由此产生的不可预测性。此外,RL 智能体的单步解释可能含混,因其未能考虑每次转移时智能体的未来行为,增加了解释机器人动作的复杂性。通过利用映射到任务特定原语的抽象动作,我们避免在运动层面进行解释。为进一步提升机器人系统的透明性与可解释性,我们提出一种可解释 Q-Map 学习框架,将奖励分解(RD)与抽象动作空间结合,从而基于任务中的物体属性给出无歧义的高层解释。我们通过两个机器人场景的定量与定性分析展示框架有效性,呈现源自 RD 解释输出产物的视觉与文本解释,易于人类理解。此外,我们展示了将这些产物与大型语言模型(LLMs)集成用于推理与交互式查询的通用性。

关键词

引用

@article{arxiv.2304.12958,
  title  = {A Closer Look at Reward Decomposition for High-Level Robotic Explanations},
  author = {Wenhao Lu and Xufeng Zhao and Sven Magg and Martin Gromniak and Mengdi Li and Stefan Wermter},
  journal= {arXiv preprint arXiv:2304.12958},
  year   = {2023}
}

备注

https://lukaswill.github.io