中文

将策略摘要与奖励分解相整合以解释强化学习智能体

机器学习 2024-02-28 v1 人工智能 人机交互

摘要

解释在序贯决策环境中运行的强化学习智能体的行为具有挑战性,因为其行为受动态环境与延迟奖励影响。帮助用户理解此类智能体行为的方法大致可分为分析智能体特定决策的局部解释,与传达智能体总体策略的全局解释。本工作中,我们研究了一种针对强化学习智能体的局部与全局解释的新颖组合。具体而言,我们将奖励分解(一种暴露奖励函数哪些分量影响了特定决策的局部解释方法)与 HIGHLIGHTS(一种展示智能体在决定性状态中行为摘要的全局解释方法)相结合。我们开展了两项用户研究以评估这些解释方法的整合及其各自益处。我们的结果显示两种方法均有显著益处。总体而言,我们发现局部奖励分解更有助于识别智能体的优先级。然而,当智能体偏好间仅存在微小差异时,HIGHLIGHTS 提供的全局信息进一步提升了参与者的理解。

关键词

引用

@article{arxiv.2210.11825,
  title  = {Integrating Policy Summaries with Reward Decomposition for Explaining Reinforcement Learning Agents},
  author = {Yael Septon and Tobias Huber and Elisabeth André and Ofra Amir},
  journal= {arXiv preprint arXiv:2210.11825},
  year   = {2024}
}