考察强化学习智能体在个性化任务中的策略熵
机器学习
2024-04-30 v4 人工智能
数值分析
数值分析
最优化与控制
摘要
本工作聚焦于考察强化学习系统在个性化环境中的行为,并详述与所采用学习算法类型相关的策略熵差异。我们证明策略优化(Policy Optimization)智能体在训练过程中常具有低熵策略,这在实际中导致智能体优先选择某些动作而回避其他动作。反之,我们也展示 Q-Learning 智能体远不易受此类行为影响,并在整个训练过程中通常维持高熵策略,而这往往在真实应用中更受青睐。我们提供了广泛的数值实验以及理论依据,以表明这些熵差异源于所采用的学习类型。
引用
@article{arxiv.2211.11869,
title = {Examining Policy Entropy of Reinforcement Learning Agents for Personalization Tasks},
author = {Anton Dereventsov and Andrew Starnes and Clayton G. Webster},
journal= {arXiv preprint arXiv:2211.11869},
year = {2024}
}