选择悖论:在分层强化学习中使用注意力机制
机器学习
2022-01-25 v1 人工智能
摘要
决策型 AI 智能体常常面临两个重要挑战:规划视野的深度,以及因选择众多而产生的分支因子。分层强化学习方法旨在通过提供跨越多个时间步的捷径来解决第一个问题。为了应对广度问题,在每个步骤将智能体的注意力限制在合理数量的可能选择上是可取的。功能可供性(Gibson, 1977)的概念表明,只有某些动作在特定状态下是可行的。在这项工作中,我们通过一种注意力机制来建模“功能可供性”,该机制限制了时间扩展选项的可用选择。我们提出了一种在线、无模型的算法来学习功能可供性,这些可供性可用于进一步学习子目标选项。我们研究了硬注意力与软注意力在训练数据收集、长视野任务中的抽象价值学习以及处理不断增长的选择数量方面的作用。我们识别并实证说明了选择悖论出现的场景,即当拥有更少但更有意义的选择时,强化学习智能体的学习速度和性能反而得到提升。
引用
@article{arxiv.2201.09653,
title = {The Paradox of Choice: Using Attention in Hierarchical Reinforcement Learning},
author = {Andrei Nica and Khimya Khetarpal and Doina Precup},
journal= {arXiv preprint arXiv:2201.09653},
year = {2022}
}
备注
20 pages, 15 figures