中文

强化学习中干预鲁棒性的度量

机器学习 2022-09-20 v1 人工智能

摘要

近期强化学习的研究聚焦于所学策略超越奖励最大化的若干特性。这些性质包括公平性、可解释性、泛化性与鲁棒性。在本文中,我们定义了干预鲁棒性(IR),用以度量训练过程中偶然因素(如训练数据顺序或智能体所采取的具体探索性动作)给所学策略引入的变异性大小。当所产生的智能体在这些偶然因素变化下,于干预时采取极为相似的动作,则该训练过程具有高 IR。我们开发了一种直观、定量的 IR 度量,并在三个 Atari 环境中针对八种算法、跨越数十次干预与状态进行了计算。从这些实验中,我们发现 IR 随训练量与算法类型而变化,并且高性能并不像人们可能预期的那样意味着高 IR。

关键词

引用

@article{arxiv.2209.09058,
  title  = {Measuring Interventional Robustness in Reinforcement Learning},
  author = {Katherine Avery and Jack Kenney and Pracheta Amaranath and Erica Cai and David Jensen},
  journal= {arXiv preprint arXiv:2209.09058},
  year   = {2022}
}

备注

17 pages, 13 figures