中文

用目标条件强化学习学习生成模型

机器学习 2023-03-28 v1 机器学习

摘要

我们提出一种新颖的替代框架,利用目标条件强化学习学习生成模型。我们定义两个智能体:一个目标条件智能体(GC-agent)和一个监督智能体(S-agent)。给定用户输入的初始状态,GC-agent 学习重构训练集。在此语境下,训练集中的元素即为目标。训练期间,S-agent 学习模仿 GC-agent,同时对目标保持不可知。在推理时,我们用 S-agent 生成新样本。遵循与变分自编码器类似的路径,我们推导出负对数似然的上界,该上界由重构项和 GC-agent 策略与(目标不可知的)S-agent 策略之间的散度构成。我们通过实验证明,我们的方法能够在图像合成任务中生成多样且高质量的样本。

关键词

引用

@article{arxiv.2303.14811,
  title  = {Learning Generative Models with Goal-conditioned Reinforcement Learning},
  author = {Mariana Vargas Vieyra and Pierre Ménard},
  journal= {arXiv preprint arXiv:2303.14811},
  year   = {2023}
}