用于离线策略学习的深度生成模型:教程、综述与未来方向展望
机器学习
2024-05-28 v5 人工智能
摘要
深度生成模型(DGMs)在各个领域均取得了巨大成功,尤其是在利用从离线数据训练的模型生成文本、图像和视频方面。类似地,数据驱动的决策制定和机器人控制也需要从离线数据中学习一个生成器函数,以作为策略或决策方针。在这种情况下,将深度生成模型应用于离线策略学习展现出巨大的潜力,并且已有大量研究对该方向进行了探索。然而,该领域仍缺乏全面的综述,导致不同分支的发展相对独立。在本文中,我们首次对深度生成模型在离线策略学习中的应用进行了系统性综述。具体而言,我们涵盖了五种主流的深度生成模型,包括变分自编码器、生成对抗网络、归一化流、Transformers 和扩散模型,以及它们在离线强化学习(offline RL)和模仿学习(IL)中的应用。离线 RL 和 IL 是离线策略学习的两个主要分支,也是被广泛采用的序列决策技术。值得注意的是,对于每种基于 DGM 的离线策略学习,我们提炼了其基本方案,根据 DGM 的使用方式对相关工作进行了分类,并梳理了该领域算法的发展过程。在正文之后,我们对深度生成模型和离线策略学习进行了深入讨论作为总结,并在此基础上提出了对未来研究方向的展望。这项工作为深度生成模型在离线策略学习中的研究进展提供了实践参考,旨在启发更优的基于 DGM 的离线 RL 或 IL 算法。为方便起见,我们在 https://github.com/LucasCJYSDL/DGMs-for-Offline-Policy-Learning 维护了论文列表。
引用
@article{arxiv.2402.13777,
title = {Deep Generative Models for Offline Policy Learning: Tutorial, Survey, and Perspectives on Future Directions},
author = {Jiayu Chen and Bhargav Ganguly and Yang Xu and Yongsheng Mei and Tian Lan and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2402.13777},
year = {2024}
}
备注
We restructured the paper and added more discussion