多目标优化下 Wasserstein 逆向强化学习的模仿证明
机器学习
2023-05-19 v2 人工智能
机器学习
摘要
我们证明,对于多目标优化,Wasserstein 逆向强化学习能够使学习者的奖励值在有限次迭代内模仿专家的奖励值。此外,我们证明,对于具有字典序的多目标优化,Wasserstein 逆向强化学习能够使学习者的最优解模仿专家的最优解。
引用
@article{arxiv.2305.10089,
title = {A proof of imitation of Wasserstein inverse reinforcement learning for multi-objective optimization},
author = {Akira Kitaoka and Riki Eto},
journal= {arXiv preprint arXiv:2305.10089},
year = {2023}
}
备注
9 pages. This text is continuation from arXiv:2305.06137