Wasserstein距离最大化内在控制
机器学习
2021-10-29 v1 人工智能
摘要
本文研究在缺乏奖励信号情况下学习以技能为条件的策略使其有意义地行动的问题。基于互信息的目标已在此设定下于学习到达多样化状态集的技能上显示出一定成功。这些目标包含一个KL散度项,其通过访问不同状态而最大化,即使那些状态在MDP中相距不远。本文提出一种方法,奖励智能体学习使其状态访问与技能起始状态的Wasserstein距离最大化的技能。它表明此类目标导致的策略比基于多样性的目标在MDP中覆盖更大距离,并在多种Atari环境中验证了结果。
引用
@article{arxiv.2110.15331,
title = {Wasserstein Distance Maximizing Intrinsic Control},
author = {Ishan Durugkar and Steven Hansen and Stephen Spencer and Volodymyr Mnih},
journal= {arXiv preprint arXiv:2110.15331},
year = {2021}
}