通过后继状态度量学习多样化技能的探索
人工智能
2024-06-17 v1 机器人学
摘要
执行不同技能的能力可以鼓励代理人进行探索。在本工作中,我们旨在构建一组均匀覆盖状态空间的多样化技能集合。我们提出了一种对多样化技能搜索的形式化定义,基于此前基于状态与技能之间互信息的定义。我们考虑由每种技能条件化后的策略到达的状态分布,并利用后继状态度量来最大化这些技能分布之间的差异。我们称这种方法为LEADS:通过后继状态学习多样化技能。我们在一组迷宫导航和机器人控制任务上演示了该方法,显示出该方法能够在不依赖奖励或探索奖励的情况下构建覆盖整个状态空间的多样化技能集合。我们的发现表明,这种新的形式化通过结合互信息最大化和探索奖励,促进了更稳健和更高效的探索。
引用
@article{arxiv.2406.10127,
title = {Exploration by Learning Diverse Skills through Successor State Measures},
author = {Paul-Antoine Le Tolguenec and Yann Besse and Florent Teichteil-Konigsbuch and Dennis G. Wilson and Emmanuel Rachelson},
journal= {arXiv preprint arXiv:2406.10127},
year = {2024}
}