中文

高效探索的无监督学习:通过自设目标预训练自适应策略

机器学习 2026-01-28 v1 人工智能 机器人学

摘要

无监督预训练能够为强化学习智能体赋予先验知识,并加速下游任务的学习。一个基于人类发展的有前景方向是研究通过设定和追求自身目标来学习的智能体。核心挑战在于如何有效地生成、选择并从这些目标中学习。我们关注的是广泛的下游任务分布,在这些任务中,零样本解决每一个任务是不可行的。当目标任务位于预训练分布之外或智能体不知道任务的身份时,这种设定自然产生。在本工作中,我们 在元学习框架内优化高效的多回合探索与适应,并 使用智能体适应后性能的动态估计来指导训练课程。我们提出了 ULEE,一种无监督元学习方法,它将上下文学习器与对抗性目标生成策略相结合,使训练保持在智能体能力的前沿。在 XLand-MiniGrid 基准测试上,ULEE 预训练产生了改进的探索和适应能力,这些能力泛化到新的目标、环境动态和地图结构。所得策略获得了改进的零样本和少样本性能,并为更长的微调过程提供了强有力的初始化。它优于从零开始学习、DIAYN 预训练和替代课程。

关键词

引用

@article{arxiv.2601.19810,
  title  = {Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals},
  author = {Octavio Pappalardo},
  journal= {arXiv preprint arXiv:2601.19810},
  year   = {2026}
}

备注

To appear at ICLR 2026