具有语义可解释性生成的关联可解释多目标强化学习
系统与控制
2019-09-27 v1 机器学习
系统与控制
最优化与控制
摘要
求解多目标优化问题在各类应用中十分重要,用户往往希望获得满足多个但通常相互冲突目标的最优策略。获取最优策略的典型方法是先基于各目标的标量化构造损失函数,再寻找使该损失最小的最优策略。然而,优化标量化(且加权)损失并不一定能保证在每个可能冲突的目标上都表现良好,因为在不了解这些目标间关系的情况下很难赋予恰当权重。此外,这些梯度下降算法的有效性受限于智能体向人类用户解释其决策与行为的能力。本研究的目的有二。首先,我们提出一种基于向量值函数的多目标强化学习(V2f-MORL)方法,在某一目标对他者的影响未知时,通过强化学习(RL)量化目标间关系。具体地,我们构造一个 actor 与多个 critic,以迭代方式共同学习策略与目标间关系矩阵(IORM),量化目标间相互影响。其次,我们提供一种语义表示,能基于所提 V2f-MORL 方法揭示用户为调和冲突目标所作决策策略的权衡,从而对给定优化目标下生成行为的可解释性予以说明。我们通过一个基于 MuJoCo 的机器人案例研究证明了所提方法的有效性。
引用
@article{arxiv.1909.12268,
title = {Relationship Explainable Multi-objective Reinforcement Learning with Semantic Explainability Generation},
author = {Huixin Zhan and Yongcan Cao},
journal= {arXiv preprint arXiv:1909.12268},
year = {2019}
}