中文

深度强化学习策略在跨MDP中学习共享的对抗特征

机器学习 2021-12-17 v1 人工智能 机器学习

摘要

使用深度神经网络作为函数逼近器极大地推动了强化学习算法和应用的发展。然而,我们对神经策略的决策边界几何和损失景观的了解仍然非常有限。在本文中,我们提出了一个框架来研究跨状态和跨MDP的决策边界和损失景观相似性。我们在Arcade Learning Environment的各种游戏中进行了实验,发现神经策略的高敏感度方向在不同MDP之间是相关的。我们认为这些高敏感度方向支持了非鲁棒特征在强化学习智能体训练环境间共享的假设。我们相信我们的结果揭示了深度强化学习训练中使用的环境的基本属性,并且是朝着构建鲁棒且可靠的深度强化学习智能体迈出的实质性一步。

关键词

引用

@article{arxiv.2112.09025,
  title  = {Deep Reinforcement Learning Policies Learn Shared Adversarial Features Across MDPs},
  author = {Ezgi Korkmaz},
  journal= {arXiv preprint arXiv:2112.09025},
  year   = {2021}
}

备注

Published in AAAI 2022