中文

动作充分的目标表示

机器学习 2026-02-02 v1 人工智能

摘要

离线目标条件强化学习(GCRL)中的层次化策略通过将控制分解为高层子目标规划和低层动作执行来解决长时域任务。在这种架构中,一个关键的设计选择是目标表示——作为这些层级之间接口的目标的压缩编码。现有方法通常在学习价值函数的同时推导目标表示,隐含地假设保留足以进行价值估计的信息对于最优控制是足够的。我们表明,即使价值估计是精确的,这个假设也可能失败,因为这样的表示可能会坍缩那些在动作学习中需要区分的状态。为了解决这个问题,我们引入了一个信息论框架,定义了动作充分性,这是最优动作选择所需的目标表示的一个条件。我们证明了价值充分性并不意味着动作充分性,并通过实验验证了后者在离散环境中与控制成功更密切相关。我们进一步证明,低层策略的标准对数损失训练自然地诱导出动作充分的表示。我们在一个流行基准上的实验结果表明,我们由动作器推导出的表示始终优于通过价值估计学习到的表示。

关键词

引用

@article{arxiv.2601.22496,
  title  = {Action-Sufficient Goal Representations},
  author = {Jinu Hyeon and Woobin Park and Hongjoon Ahn and Taesup Moon},
  journal= {arXiv preprint arXiv:2601.22496},
  year   = {2026}
}