中文

可学习行为控制:通过样本高效行为选择打破Atari人类世界纪录

机器学习 2025-10-28 v2 人工智能

摘要

探索问题是深度强化学习(RL)的主要挑战之一。近期有前景的工作尝试用基于种群的方法处理该问题,即从不同探索策略种群中采集具有多样行为的数据。自适应策略选择已被用于行为控制。然而,行为选择空间受预定义策略种群限制,进一步制约了行为多样性。本文提出一种称为可学习行为控制(LBC)的通用框架以解决该局限:a)通过构建源自所有策略的混合行为映射,显著扩大行为选择空间;b)构建统一可学习的行为选择过程。我们将LBC引入分布式离策略actor-critic方法,并通过基于bandit的元控制器优化行为映射选择实现行为控制。我们的智能体在Arcade学习环境中以1B训练帧内达到10077.52%平均人类归一化得分,并超越24项人类世界纪录,展示了我们在不损失样本效率下的显著SOTA性能。

关键词

引用

@article{arxiv.2305.05239,
  title  = {Learnable Behavior Control: Breaking Atari Human World Records via Sample-Efficient Behavior Selection},
  author = {Jiajun Fan and Yuzheng Zhuang and Yuecheng Liu and Jianye Hao and Bin Wang and Jiangcheng Zhu and Hao Wang and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2305.05239},
  year   = {2025}
}