中文

用于探索的虚拟动作演员-评论家框架(学生摘要)

机器学习 2023-11-07 v1 人工智能

摘要

在强化学习(RL)中,智能体的高效探索是一项挑战。本文提出一种新颖的演员-评论家框架,即虚拟动作演员-评论家(VAAC),以应对 RL 中高效探索的挑战。该工作受人类无需实际采取行动即可想象其行动潜在结果的能力启发。为模拟此能力,VAAC 在常规演员-评论家框架之外引入一个名为虚拟演员(VA)的新演员。与常规演员不同,VA 采取虚拟动作以预见下一状态,而无需与环境交互。在虚拟策略服从高斯分布的情况下,VA 被训练以最大化由虚拟动作导致的后续状态的预期新颖性。若可用动作产生的任何下一状态均未表现出高预期新颖性,训练 VA 会导致虚拟策略熵增加。因此,高虚拟策略熵表示没有探索空间。所提出的 VAAC 旨在最大化一个修正的 Q 函数,该函数结合了累积奖励与虚拟策略熵的负和。实验结果表明,与现有算法相比,VAAC 提升了探索性能。

关键词

引用

@article{arxiv.2311.02916,
  title  = {Virtual Action Actor-Critic Framework for Exploration (Student Abstract)},
  author = {Bumgeun Park and Taeyoung Kim and Quoc-Vinh Lai-Dang and Dongsoo Har},
  journal= {arXiv preprint arXiv:2311.02916},
  year   = {2023}
}