可学习行为控制:通过样本高效行为选择打破Atari人类世界纪录
机器学习
2025-10-28 v2 人工智能
摘要
探索问题是深度强化学习(RL)的主要挑战之一。近期有前景的工作尝试用基于种群的方法处理该问题,即从不同探索策略种群中采集具有多样行为的数据。自适应策略选择已被用于行为控制。然而,行为选择空间受预定义策略种群限制,进一步制约了行为多样性。本文提出一种称为可学习行为控制(LBC)的通用框架以解决该局限:a)通过构建源自所有策略的混合行为映射,显著扩大行为选择空间;b)构建统一可学习的行为选择过程。我们将LBC引入分布式离策略actor-critic方法,并通过基于bandit的元控制器优化行为映射选择实现行为控制。我们的智能体在Arcade学习环境中以1B训练帧内达到10077.52%平均人类归一化得分,并超越24项人类世界纪录,展示了我们在不损失样本效率下的显著SOTA性能。
引用
@article{arxiv.2305.05239,
title = {Learnable Behavior Control: Breaking Atari Human World Records via Sample-Efficient Behavior Selection},
author = {Jiajun Fan and Yuzheng Zhuang and Yuecheng Liu and Jianye Hao and Bin Wang and Jiangcheng Zhu and Hao Wang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2305.05239},
year = {2025}
}