强化学习中学习时间顺序约束下的隐藏子目标
机器学习
2024-11-05 v1 人工智能
系统与控制
系统与控制
摘要
在实际应用中,完成任务的成功往往取决于多个相距远时的关键步骤,这些步骤必须按固定的时间顺序实现。例如,烹饪食谱中列出的关键步骤应按正确的顺序逐一实现。这些关键步骤可被视为任务的子目标,其时间顺序由时间顺序约束(temporal ordering constraints)所描述。然而,在许多实际问题中,子目标或关键状态常常隐藏在状态空间中,其时间顺序约束也是未知的,这使得先前的强化学习算法难以解决此类任务。为此,本文提出了一种新的强化学习算法,用于学习隐藏子目标下的时间顺序约束(Learning Hidden Subgoals under Temporal Ordering Constraints, LSTOC)。我们提出了新的对比学习目标,能够有效地同时学习隐藏子目标(关键状态)及其时间顺序,基于首次占用表示(first-occupancy representation)和时间几何采样(temporal geometric sampling)。此外,我们提出了一种高效的学习策略,通过构建子目标树来逐一地遵循子目标的时间顺序约束来发现子目标。具体而言,该树可用于提高轨迹收集的样本效率,加快任务解决速度,并可推广到未见任务。我们在多个基于图像观察的环境中对LSTOC框架进行评估,显示其相对于基线方法具有显著的改进。
引用
@article{arxiv.2411.01425,
title = {Learning Hidden Subgoals under Temporal Ordering Constraints in Reinforcement Learning},
author = {Duo Xu and Faramarz Fekri},
journal= {arXiv preprint arXiv:2411.01425},
year = {2024}
}