中文

元学习如何在宏动作之间共享信用

机器学习 2025-06-17 v1 人工智能

摘要

改进强化学习探索的一种 proposed mechanism 是使用宏动作。然而,尽管如此,许多情景下,简单地添加宏动作并不会导致更好的探索,反而往往相反。人们曾认为,这是由于添加了无用的宏动作,导致多个研究工作聚焦于发现环境特定有效宏动作的机制。本文采取了略为不同的视角。我们认为,困难源于:在平均每集决策次数减少 与 动作空间增大之间存在权衡。也就是说,通常将每个潜在宏动作视为独立且原子化的,从而严格增加搜索空间,使典型的探索策略变得低效。为此,我们提出一种新型正则化项,该项利用动作与宏动作之间的关系,通过降低有效动作空间的维度来改进信用分配机制,从而提高探索效率。该项依赖于一个 meta-学习 的相似度矩阵,联合学习所需策略。我们在 Atari 游戏和 StreetFighter II 环境中对宏动作进行经验验证。我们的结果显示,在所有环境中,都相较于 Rainbow-DQN 基线实现了显著改进。此外,我们展示了宏动作相似度可转移到相关环境。我们认为本工作是通向理解如何利用作用空间上的相似度几何结构来改进信用分配和探索,从而使学习更有效的重要一步。

关键词

引用

@article{arxiv.2506.13690,
  title  = {Meta-learning how to Share Credit among Macro-Actions},
  author = {Ionel-Alexandru Hosu and Traian Rebedea and Razvan Pascanu},
  journal= {arXiv preprint arXiv:2506.13690},
  year   = {2025}
}