基于深度注意力卷积神经网络的零样本强化学习
机器学习
2020-01-06 v1 机器人学
系统与控制
系统与控制
摘要
神经网络模型的仿真到仿真以及仿真到真实世界的迁移一直是个难题。为缩小现实差距,先前的仿真到真实世界迁移方法侧重于域适应、解耦感知与动力学并分别解决各问题,以及对智能体参数和环境条件进行随机化以使学习智能体暴露于多种条件。尽管这些方法提供了可接受的性能,但在自主驾驶或机器人操控等给定任务上捕捉全面场景的大量参数变化所需的计算复杂度很高。我们的关键贡献是从理论上证明并经验性地展示:具有特定视觉传感器配置的深度注意力卷积神经网络(DACNN)在以更低计算复杂度下,表现与在高域和参数变化数据集上训练相当。具体而言,注意力网络权重通过策略优化学习,以聚焦于导致最优动作的局部依赖关系,且不需要在真实世界中调优以泛化。我们的新架构针对控制目标调整感知,从而实现无需预训练感知网络的零样本学习。为衡量我们的新深度网络架构对域适应的影响,我们考虑以自主驾驶为用例。我们在仿真到仿真和仿真到真实场景中进行了一组广泛的实验,将我们的方法与包括当前最先进模型在内的若干基线进行比较。
引用
@article{arxiv.2001.00605,
title = {Zero-Shot Reinforcement Learning with Deep Attention Convolutional Neural Networks},
author = {Sahika Genc and Sunil Mallya and Sravan Bodapati and Tao Sun and Yunzhe Tao},
journal= {arXiv preprint arXiv:2001.00605},
year = {2020}
}