中文

Q-learning 能解决多臂老虎机问题吗?

机器学习 2021-10-22 v1 人工智能

摘要

当强化学习(RL)方法仅通过接收到的奖励在若干可选策略间做决策时,它必须隐式地优化一个多臂老虎机(MAB)问题。这就引出一个问题:当前的 RL 算法能否解决 MAB 问题?我们主张令人惊讶的答案是否定的。在我们的实验中,我们展示在某些情况下它们无法解决基本的 MAB 问题,并且在许多常见情况下它们举步维艰:它们在训练期间遭受结果回归、对初始化敏感以及高样本复杂度。我们主张这源于策略间的方差差异,这导致两个问题:第一个问题是“无聊策略陷阱”,其中每个策略具有不同的隐式探索,取决于其奖励方差,而离开一个无聊的或低方差的策略由于其低隐式探索而不太可能。第二个问题是“操纵型顾问”问题,深度 RL 算法(如 DQN 或深度 Actor Critic 方法)中使用的值估计函数最大化估计精度而非平均奖励,并且在低方差策略中具有更好的损失,这导致网络收敛到次优策略。对人类的认知实验表明,带噪奖励信号可能矛盾地改善表现。我们用上述问题描述此现象,主张人类与算法在决策中可能面临相似挑战。受该结果启发,我们提出自适应对称奖励加噪(ASRN)方法,意指均衡不同策略间的奖励方差,从而在不影响环境平均奖励行为的情况下避免这两个问题。我们证明 ASRN 方案能显著改善结果。

关键词

引用

@article{arxiv.2110.10934,
  title  = {Can Q-learning solve Multi Armed Bantids?},
  author = {Refael Vivanti},
  journal= {arXiv preprint arXiv:2110.10934},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1905.10144