基于建议新颖度的学生主动动作建议
机器学习
2021-10-12 v2 机器学习
摘要
动作建议是一种教师-学生同伴间受预算约束的知识交换机制,可帮助解决深度强化学习 (RL) 中的探索与样本低效问题。近来,利用状态新颖度与不确定性估计的学生主动技术取得了可喜结果。然而,基于这些估计的方法存在一些潜在弱点。首先,它们假设学生 RL 模型的收敛意味着更少建议需求。在教师早期缺席、学生很可能自学至次优的情形下,这会产生误导;且后期忽视了教师的协助。其次,在经验回放动态下,状态遭遇与在 RL 模型更新中生效之间的延迟,导致学生实际所需建议存在反馈滞后。我们提出了一种学生主动算法,通过采用随机网络蒸馏 (RND) 度量一条建议的新颖度来缓解这些问题。此外,我们仅对建议状态执行 RND 更新,以确保学生自身学习不损害其利用教师的能力。在 GridWorld 与 MinAtar 上的实验表明,我们的方法与最先进方法表现相当,并在现有方法易失败的场景中展现出显著优势。
引用
@article{arxiv.2010.00381,
title = {Student-Initiated Action Advising via Advice Novelty},
author = {Ercument Ilhan and Jeremy Gow and Diego Perez-Liebana},
journal= {arXiv preprint arXiv:2010.00381},
year = {2021}
}