基于内在动机目标条件强化学习的自导向智能体:简要综述
机器学习
2026-01-30 v7 人工智能
摘要
构建能够探索开放式环境、发现可能交互并建立技能库的自主机器是人工智能的通用目标。发展式方法认为,这只能由自导向(autotelic)智能体实现:即能够学习表征、生成、选择并解决自身问题的内在动机学习智能体。近年来,发展式方法与深度强化学习(RL)方法的融合催生了一个新领域:发展式强化学习(developmental reinforcement learning)。发展式强化学习关注利用深度RL算法解决发展式问题——技能开放库的内在动机获取。目标的自生成要求学习紧凑的目标编码及其关联的目标达成函数。相较于最初设计用于使用外部奖励信号处理预定义目标集的标准RL算法,这带来了新的挑战。本文介绍发展式强化学习,并提出基于目标条件RL的计算框架以应对内在动机技能获取问题。接着呈现文献中使用的各类目标表征的类型学,而后回顾在自主系统中学习表征与优先级排序目标的现有方法。最后,我们讨论内在动机技能获取探索中的一些开放挑战。
引用
@article{arxiv.2012.09830,
title = {Autotelic Agents with Intrinsically Motivated Goal-Conditioned Reinforcement Learning: a Short Survey},
author = {Cédric Colas and Tristan Karch and Olivier Sigaud and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:2012.09830},
year = {2026}
}