中文

基于满意化线性近似方法的情境化探索

机器学习 2021-12-14 v1

摘要

深度强化学习已在各类游戏中实现了人类水平甚至超人类的性能。然而,学习所需的探索量往往相当大。深度强化学习在探索量上也具有超人类性能,因为没有任何人能够完成如此大量的探索。为解决此问题,我们关注满意化(satisficing)策略,这是一种与现有优化算法性质不同的方法。因此,我们提出 Linear RS(LinRS),它是一种满意化算法,也是风险敏感满意化(RS)的线性扩展,以应用于更广泛的任务。RS 的推广提供了一种通过采用与现有优化算法不同方法来减少探索动作量的算法。LinRS 利用线性回归和多类分类来线性近似 RS 计算所需的动作价值与动作选择比例。我们的实验结果表明,在情境化赌博机(contextual bandit)问题中,与现有算法相比,LinRS 减少了探索次数与运行时间。这些结果表明,满意化算法的进一步推广可能对复杂环境(包括需用深度强化学习处理的环境)有用。

关键词

引用

@article{arxiv.2112.06452,
  title  = {Contextual Exploration Using a Linear Approximation Method Based on Satisficing},
  author = {Akane Minami and Yu Kono and Tatsuji Takahashi},
  journal= {arXiv preprint arXiv:2112.06452},
  year   = {2021}
}

备注

27 pages, 2 figures