中文

强化学习:聚焦调整策略以到达目标

机器学习 2024-12-24 v1

摘要

强化学习智能体的目标是通过探索发现更好的动作。然而,典型的探索技术旨在最大化奖励,往往在探索和学习过程中造成高额成本。我们提出了一种新颖的深度强化学习方法,优先实现某一期望水平,而非最大化预期回报。该方法可灵活根据目标实现比例调整探索程度。通过在运动控制任务和导航任务上的实验,本方法的回报等于或超过其他标准方法。分析结果表明:我们的 метод可灵活调整探索范围,且有望使智能体适应非平稳环境。这些发现表明,该方法在提高强化学习实际应用中的探索效率方面可能具有有效性。

关键词

引用

@article{arxiv.2412.17344,
  title  = {Reinforcement Learning with a Focus on Adjusting Policies to Reach Targets},
  author = {Akane Tsuboya and Yu Kono and Tatsuji Takahashi},
  journal= {arXiv preprint arXiv:2412.17344},
  year   = {2024}
}

备注

Accepted by AROB-ISBC 2025