基于联合训练生成潜空间、面向强化学习智能体的结果引导反事实样本
人工智能
2022-07-19 v1 机器学习
摘要
我们提出了一种新颖的生成方法,用于基于表征智能体行为的结果变量,为强化学习(RL)智能体生成未见且合理的反事实样本。我们的方法使用变分自编码器来训练一个潜空间,该空间联合编码与智能体行为相关的观测信息和结果变量。反事实样本通过在该潜空间中进行遍历来生成,具体采用梯度驱动更新以及针对从样本池中选取的案例进行潜空间插值。其中包括提高生成样本似然的更新,从而改善生成反事实样本的合理性。通过在三个RL环境中的实验,我们表明与纯粹结果驱动或基于案例的基线相比,这些方法产生的反事实样本更合理且更接近于其查询。最后,我们表明,联合训练以重建输入观测和行为结果变量的潜空间,比仅训练以重建观测输入的潜空间能产生更高质量的反事实样本。
引用
@article{arxiv.2207.07710,
title = {Outcome-Guided Counterfactuals for Reinforcement Learning Agents from a Jointly Trained Generative Latent Space},
author = {Eric Yeh and Pedro Sequeira and Jesse Hostetler and Melinda Gervasio},
journal= {arXiv preprint arXiv:2207.07710},
year = {2022}
}