中文

CURIOUS:内在动机的模块化多目标强化学习

人工智能 2026-01-30 v5

摘要

在开放式环境中,自主学习智能体必须通过内在动机探索来设定自身目标并构建自身课程。它们可能考虑种类繁多的目标,旨在发现环境中哪些是可控制的、哪些是不可控制的。由于某些目标可能容易、某些不可能,智能体必须主动选择任一时刻练习哪个目标,以最大化其对可学习目标集合的整体掌握程度。本文提出 CURIOUS,一种利用 1)带后见之明的模块化通用值函数逼近器以在唯一策略内实现多种类目标的多样性,以及 2)一种自动课程学习机制(其将智能体注意力偏置向最大化绝对学习进度的目标)的算法。智能体依次聚焦于复杂度递增的目标,并回过头聚焦于正被遗忘的目标。在一个新的模块化目标机器人环境中进行的实验显示了学习课程的发展式自组织,并展示了针对干扰目标、遗忘及身体属性变化的鲁棒性。

关键词

引用

@article{arxiv.1810.06284,
  title  = {CURIOUS: Intrinsically Motivated Modular Multi-Goal Reinforcement Learning},
  author = {Cédric Colas and Pierre Fournier and Olivier Sigaud and Mohamed Chetouani and Pierre-Yves Oudeyer},
  journal= {arXiv preprint arXiv:1810.06284},
  year   = {2026}
}

备注

Accepted at ICML 2019 https://github.com/flowersteam/curious