环境无关的目标条件化:奖励自由自主学习研究
机器学习
2025-11-07 v1
摘要
本文我们研究了将常规强化学习环境转化为目标条件化环境,以让智能体在无奖励情况下自主学习解决任务的方式。我们表明,智能体可以通过环境无关的方式选择自身目标来学习解决任务,训练时间与外部引导的强化学习相当。我们的方法独立于底层的off-policy学习算法。由于该方法环境无关,智能体不会对任何目标赋予更高的价值,导致单个目标性能不稳定。然而,在我们的实验中,我们发现平均目标成功率得到改善并趋于稳定。经过该方法训练的智能体可以被指示寻找环境中任何观察,实现特定用例之前的通用智能体训练。
引用
@article{arxiv.2511.04598,
title = {Environment Agnostic Goal-Conditioning, A Study of Reward-Free Autonomous Learning},
author = {Hampus Åström and Elin Anna Topp and Jacek Malec},
journal= {arXiv preprint arXiv:2511.04598},
year = {2025}
}
备注
8 pages without cover, references and supplementary materials, 11 with. Submitted to RLC 2025's workshop RLBrew and IMOL 2025