中文

一次性学习一切的目标条件化智能体

机器学习 2026-05-25 v1 人工智能

摘要

在环境中探索的目标条件化强化学习智能体将看到大量信息,但仅针对命令目标执行的单纯on-policy更新时,大部分信息被丢弃。所有目标学习(all-goals learning)即每个转换都用于针对每个目标进行off-policy学习,允许智能体提取最大信息,但通常通过笨拙的重新标记方式在计算上不可行。通过同时输出每个目标的值和动作,可以实现用单次网络遍历进行高效、并行的所有目标更新,称为Learning Everything all at Once(LEO)。我们表明,该方法在目标条件化Craftax上显著优于其他方法,在连续控制环境中与现有基线相当,同时实现了比所有目标重新标记快超过250倍。随后我们表明,该方法可进一步通过将LEO作为教师网络而非直接演员来增强效能。我们希望通过大规模实现所有目标学习,LEO可作为RL从业者处理复杂环境的有用工具。我们开源了代码。

关键词

引用

@article{arxiv.2605.23551,
  title  = {Goal-Conditioned Agents that Learn Everything All at Once},
  author = {Michael Matthews and Matthew Jackson and Michael Beukman and Thomas Foster and Alistair Letcher and Scott Fujimoto and Cédric Colas and Jakob Foerster},
  journal= {arXiv preprint arXiv:2605.23551},
  year   = {2026}
}