从生成模型中免费获得反事实控制
机器学习
2017-03-10 v2 机器学习
摘要
我们提出一种方法,利用学习动作与未来状态联合分布的生成模型,自动推断出适用于任意期望奖励函数的控制方案,且该奖励函数可随时更改而无需重新训练模型。在该方法中,动作选择问题被简化为在生成模型隐空间上的梯度下降问题,模型本身提供了评估结果和求解梯度的途径,这与深度Q网络(DQN)中奖励网络为动作生成器提供梯度信息的方式非常相似。与DQN或Actor-Critic等针对特定奖励的条件模型不同,使用完整联合分布的生成模型允许奖励随时更改。此外,生成的未来状态可以被检视,以洞察网络“认为”会发生什么,以及当结果偏离预测时,问题出在哪里。
引用
@article{arxiv.1702.06676,
title = {Counterfactual Control for Free from Generative Models},
author = {Nicholas Guttenberg and Yen Yu and Ryota Kanai},
journal= {arXiv preprint arXiv:1702.06676},
year = {2017}
}
备注
6 pages, 5 figures