神经算法策略实现快速组合泛化
机器学习
2021-02-16 v1 人工智能
离散数学
摘要
尽管基于模型与无模型的学习系统控制方法在标准基准上取得了令人印象深刻的成果,但对任务变化的泛化能力仍然不足。近期结果表明,标准架构的泛化能力仅在获取海量数据后才有所提升。我们给出证据表明,泛化能力在许多情况下受限于对问题组合方面泛化的无能。此外,我们展示了对于MDP框架的某个子类,这可通过神经算法架构得以缓解。许多控制问题需要长期规划,而仅用神经网络难以通用地求解。我们引入了一种由神经网络和嵌入式时变最短路径求解器组成的神经算法策略架构。这些策略可通过黑盒微分进行端到端训练。我们展示了此类架构在仅见少量环境示例后,即对环境中未见的变体具有良好的泛化能力。
引用
@article{arxiv.2102.07456,
title = {Neuro-algorithmic Policies enable Fast Combinatorial Generalization},
author = {Marin Vlastelica and Michal Rolínek and Georg Martius},
journal= {arXiv preprint arXiv:2102.07456},
year = {2021}
}
备注
15 pages