中文

从生成模型中免费获得反事实控制

机器学习 2017-03-10 v2 机器学习

摘要

我们提出一种方法,利用学习动作与未来状态联合分布的生成模型,自动推断出适用于任意期望奖励函数的控制方案,且该奖励函数可随时更改而无需重新训练模型。在该方法中,动作选择问题被简化为在生成模型隐空间上的梯度下降问题,模型本身提供了评估结果和求解梯度的途径,这与深度Q网络(DQN)中奖励网络为动作生成器提供梯度信息的方式非常相似。与DQN或Actor-Critic等针对特定奖励的条件模型不同,使用完整联合分布的生成模型允许奖励随时更改。此外,生成的未来状态可以被检视,以洞察网络“认为”会发生什么,以及当结果偏离预测时,问题出在哪里。

关键词

引用

@article{arxiv.1702.06676,
  title  = {Counterfactual Control for Free from Generative Models},
  author = {Nicholas Guttenberg and Yen Yu and Ryota Kanai},
  journal= {arXiv preprint arXiv:1702.06676},
  year   = {2017}
}

备注

6 pages, 5 figures