使用深度 Q-学习与变分自编码器发现可解释选项
机器学习
2022-10-05 v1 人工智能
摘要
深度强化学习(RL)无疑是训练多学科自主智能体的强健框架。然而,传统的深度与浅层无模型 RL 算法在稀疏状态空间下存在样本效率低与泛化不足的问题。具有时间抽象的选项框架或许是解决这些问题最有前景的方法,但其仍有显著缺陷。它仅保证局部收敛,且自动化发起与终止条件具挑战性,实践中常需手工设计。我们的方案——深度变分 Q 网络(DVQN)——结合了深度生成式学习与强化学习。该算法从高斯分布潜空间中找到良好策略,这对定义选项尤其有用。DVQN 算法使用 MSE 与 KL 散度作为正则化,并结合传统 Q-Learning 更新。算法学习一个表示良好策略及选项状态簇的潜空间。我们表明 DVQN 算法是为基于选项的强化学习确定发起与终止条件的一种有前景的方法。实验显示,具有自动发起与终止的 DVQN 算法性能可与 Rainbow 媲美,并能在收敛后长时间训练时保持稳定性。
引用
@article{arxiv.2210.01231,
title = {Interpretable Option Discovery using Deep Q-Learning and Variational Autoencoders},
author = {Per-Arne Andersen and Ole-Christoffer Granmo and Morten Goodwin},
journal= {arXiv preprint arXiv:2210.01231},
year = {2022}
}
备注
12 pages, 5 figures, Proceedings of the 3rd International Conference on Intelligent Technologies and Applications