通过时间分解未来奖励估计器解释智能体的未来信念
人工智能
2024-08-16 v1 机器学习
摘要
未来奖励估计是强化学习智能体的核心组件,即Q值和状态价值函数,用于预测智能体未来奖励的总和。然而,其标量输出掩盖了智能体可能期望在何时或获得何种个别未来奖励。我们通过修改智能体的未来奖励估计器,使其预测接下来N个期望奖励来解决这一问题,称为时间奖励分解(Temporal Reward Decomposition, TRD)。这解锁了智能体行为的新解释。通过TRD,我们可以:估计智能体何时可能获得奖励、奖励的值以及智能体获得奖励的置信度;衡量输入特征对智能体动作决策的时间重要性;以及预测不同动作对未来奖励的影响。此外,我们表明,在Atari环境中训练的DQN智能体可以高效地重新训练以纳入TRD,且对性能的影响最小。
引用
@article{arxiv.2408.08230,
title = {Explaining an Agent's Future Beliefs through Temporally Decomposing Future Reward Estimators},
author = {Mark Towers and Yali Du and Christopher Freeman and Timothy J. Norman},
journal= {arXiv preprint arXiv:2408.08230},
year = {2024}
}
备注
7 pages + 3 pages of supplementary material. Published at ECAI 2024