中文

考察强化学习智能体在个性化任务中的策略熵

机器学习 2024-04-30 v4 人工智能 数值分析 数值分析 最优化与控制

摘要

本工作聚焦于考察强化学习系统在个性化环境中的行为,并详述与所采用学习算法类型相关的策略熵差异。我们证明策略优化(Policy Optimization)智能体在训练过程中常具有低熵策略,这在实际中导致智能体优先选择某些动作而回避其他动作。反之,我们也展示 Q-Learning 智能体远不易受此类行为影响,并在整个训练过程中通常维持高熵策略,而这往往在真实应用中更受青睐。我们提供了广泛的数值实验以及理论依据,以表明这些熵差异源于所采用的学习类型。

关键词

引用

@article{arxiv.2211.11869,
  title  = {Examining Policy Entropy of Reinforcement Learning Agents for Personalization Tasks},
  author = {Anton Dereventsov and Andrew Starnes and Clayton G. Webster},
  journal= {arXiv preprint arXiv:2211.11869},
  year   = {2024}
}