中文

解释自适系统的在线强化学习决策

机器学习 2022-10-13 v1 人工智能 软件工程

摘要

设计期不确定性在开发自适系统时构成重要挑战。例如,定义系统在面对新环境状态时应如何适应,需要理解适应的精确效果,而这在设计期可能未知。在线强化学习,即在运行时采用强化学习(RL),是在存在设计期不确定性时实现自适系统的新兴方法。通过使用在线RL,自适系统可以从实际运行数据学习,并利用仅在运行时可用的反馈。近来,深度RL日益受到关注。深度RL将习得知识表示为神经网络,从而能对未见过输入进行泛化,并处理连续环境状态与适应动作。深度RL的一个基本问题是习得知识未被显式表示。对人而言,将神经网络的参数化与具体RL决策相关联实际上不可能,因此深度RL本质上呈现为黑箱。然而,理解深度RL所做的决策对于(1)增进信任与(2)便利调试至关重要。此类调试对自适系统尤为相关,因为量化对RL算法反馈的奖励函数必须由开发者定义。奖励函数必须由开发者显式定义,从而引入了人为错误的可能。为解释自适系统的深度RL,我们增强并组合了机器学习文献中两种已有的可解释RL技术。该组合技术XRL-DINE克服了各项技术各自的局限。我们给出了XRL-DINE的概念验证实现,以及将XRL-DINE应用于一个自适系统范例的定性与定量结果。

关键词

引用

@article{arxiv.2210.05931,
  title  = {Explaining Online Reinforcement Learning Decisions of Self-Adaptive Systems},
  author = {Felix Feit and Andreas Metzger and Klaus Pohl},
  journal= {arXiv preprint arXiv:2210.05931},
  year   = {2022}
}

备注

Published at 3rd Intl Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2022)