中文

跟随你的嗅觉:在强化学习中使用通用价值函数进行定向探索

机器学习 2023-02-28 v2 人工智能

摘要

提高样本效率是强化学习中的一个关键挑战,尤其是在具有大状态空间和稀疏奖励的环境中。文献中,这一问题要么通过使用辅助任务(子目标),要么通过巧妙的探索策略来解决。探索方法已被用于在大环境中采样更好的轨迹,而辅助任务则被整合到奖励稀疏的场景中。然而,很少有研究尝试同时解决大规模和奖励稀疏这两个问题。本文探索了将探索与辅助任务学习相结合的想法,使用通用价值函数(General Value Functions, GVFs)和一种定向探索策略。我们提出了一种学习价值函数的方法,这些函数可用于采样动作并提供定向探索。在不同网格大小的导航任务上的实验展示了相对于多个有竞争力的基线的性能优势。

关键词

引用

@article{arxiv.2203.00874,
  title  = {Follow your Nose: Using General Value Functions for Directed Exploration in Reinforcement Learning},
  author = {Durgesh Kalwar and Omkar Shelke and Somjit Nath and Hardik Meisheri and Harshad Khadilkar},
  journal= {arXiv preprint arXiv:2203.00874},
  year   = {2023}
}