中文

用于目标条件强化学习的零反事实因子交互

机器学习 2025-05-07 v1 人工智能

摘要

事后重标记是克服目标条件强化学习(GCRL)中稀疏奖励问题的强大工具,尤其是在导航和运动等特定领域。然而,事后重标记在以对象为中心的领域中可能表现不佳。例如,假设目标空间包含一个机械臂将特定目标块推送到目标位置。在这种情况下,事后重标记会对任何未与该块交互的轨迹给予高奖励。然而,这些行为仅在物体已处于目标位置时才有用——这在实践中极为罕见。由这类轨迹主导的数据集会使学习复杂化并导致失败。在以对象为中心的领域中,一个关键的直觉是,有意义的轨迹通常以物体间的交互为特征,例如用夹爪推动块。为了利用这一直觉,我们引入了基于交互的事后重放(HInt),它将交互与事后重放相结合,以提高下游强化学习的样本效率。然而,由于交互缺乏一个对下游 GCRL 可处理的共识统计定义,我们基于零反事实概念提出了一个交互定义:如果在一个原因对象不存在的世界中,目标对象的转移动态会有所不同,则该原因对象正与目标对象交互。我们利用这一定义在零反事实交互推断(NCII)中推断交互,该方法使用一个带有学习模型的“归零”操作来推断交互。NCII 在简单的线性动态领域以及 Robosuite、Robot Air Hockey 和 Franka Kitchen 等动态机器人领域中,均能显著提高交互推断的准确性,而 HInt 将样本效率提升了高达 4 倍。

关键词

引用

@article{arxiv.2505.03172,
  title  = {Null Counterfactual Factor Interactions for Goal-Conditioned Reinforcement Learning},
  author = {Caleb Chuck and Fan Feng and Carl Qi and Chang Shi and Siddhant Agarwal and Amy Zhang and Scott Niekum},
  journal= {arXiv preprint arXiv:2505.03172},
  year   = {2025}
}

备注

Published at ICLR 2025