面向长视界目标条件任务的基于技能步骤抽象的策略学习
机器学习
2024-08-22 v1 人工智能
摘要
目标条件(GC)策略学习在应对长视界目标时,常面临奖励稀疏带来的挑战。为应对此挑战,我们探索了离线环境下的基于技能的GC策略学习,其中技能从现有数据中获取,长视界目标被分解为与这些技能对齐的一系列近期目标序列。具体而言,我们提出了一个“基于技能步骤抽象的离线GC策略学习”框架(GLvSA),用于处理受目标分布偏移影响的长视界GC任务。在该框架中,GC策略在离线环境下,随着数据上技能步骤抽象的逐步构建而渐进式学习。我们还设计了一种GC策略层级结构,该结构不仅能加速框架内的GC策略学习,还能实现策略的参数高效微调。通过在迷宫和厨房环境中进行实验,我们证明了GLvSA框架在使GC策略适应广泛的长视界目标方面的优越性和高效性。该框架在零样本和少样本适应方面取得了有竞争力的性能,优于现有的GC策略学习方法和基于技能的方法。
关键词
引用
@article{arxiv.2408.11300,
title = {Offline Policy Learning via Skill-step Abstraction for Long-horizon Goal-Conditioned Tasks},
author = {Donghoon Kim and Minjong Yoo and Honguk Woo},
journal= {arXiv preprint arXiv:2408.11300},
year = {2024}
}
备注
9 pages, 4 figures, International Joint Conference on Artificial Intelligence 2024, Published version