中文

通用值函数网络

机器学习 2021-02-03 v4 人工智能 机器学习

摘要

状态构造对于部分可观测环境中的学习十分重要。一种通用的状态构造策略是使用循环神经网络 (RNN) 学习状态更新,其利用当前内部状态与最近观测来更新内部状态。该内部状态提供了观测序列的摘要,以促进准确的预测与决策。同时,RNN 的指定与训练 notoriously 棘手,尤其是作为时间上近似梯度的常用策略——截断随时间反向传播 (BPTT)——可能对截断窗口敏感。此外,领域专业知识通常有助于约束函数类从而改善可训练性,却难以融入 RNN 中使用的复杂循环单元。本工作中,我们探索如何利用多步预测来约束 RNN 并融入先验知识。具体而言,我们重访利用预测构造状态的思路并追问:将(部分)状态约束为关于未来的预测是否改善 RNN 可训练性?我们提出一种称为通用值函数网络 (GVFN) 的新型 RNN 架构,其中每个内部状态分量对应于以值函数表示的关于未来的预测。我们首先给出优化 GVFNs 的目标,并推导若干算法以优化该目标。随后我们展示 GVFNs 对截断水平更具鲁棒性,在许多情况下仅需一步梯度更新。

关键词

引用

@article{arxiv.1807.06763,
  title  = {General Value Function Networks},
  author = {Matthew Schlegel and Andrew Jacobsen and Zaheer Abbas and Andrew Patterson and Adam White and Martha White},
  journal= {arXiv preprint arXiv:1807.06763},
  year   = {2021}
}

备注

Published in the Journal of Artificial Intelligence Research