中文

两个目标的故事:在多目标情景中利用序列性

机器学习 2025-03-31 v1 人工智能

摘要

许多层次化强化学习方法利用规划创建中间目标的图或序列,以引导低层目标条件(GC)策略到达最终目标。通常情况下,低层策略基于当前目标进行条件化,其目标是尽快到达该目标。然而,当中间目标可通过多种方式到达时,某些路径可能阻碍后续目标的实现。这一方法可能失败。为此,我们引入两种马尔可夫决策过程(MDP),其中优化目标不仅旨在到达当前目标,还旨在到达后续目标。在第一种情况下,智能体基于当前和最终目标进行条件化;在第二种情况下,智能体基于序列中后续两个目标进行条件化。我们在给定中间目标序列的导航和杆子平衡任务上进行一系列实验。通过评估在标准GC-MDP和我们提出的MDPs上训练的TD3+HER策略,我们表明,在大多数情况下,对后续两个目标进行条件化可在其他方法之上实现更好的稳定性和样本效率。

关键词

引用

@article{arxiv.2503.21677,
  title  = {A tale of two goals: leveraging sequentiality in multi-goal scenarios},
  author = {Olivier Serris and Stéphane Doncieux and Olivier Sigaud},
  journal= {arXiv preprint arXiv:2503.21677},
  year   = {2025}
}

备注

14 pages, 5 figures