罕见显著事件下的策略搜索:选择正确合作对象
机器学习
2022-10-12 v1 人工智能
神经与进化计算
摘要
本文关注一类强化学习问题,其中显著事件罕见且每回合仅限于单一正奖励。一个典型例子是智能体必须选择合作对象,而大量对象无论智能体提供什么都不感兴趣合作。我们在连续状态与动作空间中用两类不同的搜索方法解决此问题:梯度策略搜索方法与使用进化策略的直接策略搜索方法。我们表明,当显著事件罕见时,梯度信息也稀缺,使得策略梯度搜索方法难以找到最优策略,无论是否使用深度神经架构。另一方面,我们表明直接策略搜索方法对显著事件的罕见性保持不变,这再次证实了进化算法作为强化学习方法所发挥的独特作用。
引用
@article{arxiv.2103.06846,
title = {Policy Search with Rare Significant Events: Choosing the Right Partner to Cooperate with},
author = {Paul Ecoffet and Nicolas Fontbonne and Jean-Baptiste André and Nicolas Bredeche},
journal= {arXiv preprint arXiv:2103.06846},
year = {2022}
}