去中心化多智能体强化学习中的动态安全可中断性
人工智能
2017-05-23 v2 机器学习
多智能体系统
机器学习
摘要
在强化学习中,智能体通过执行动作并观察其结果来学习。有时,人类操作员希望中断智能体以防止危险情况发生。然而,作为学习过程的一部分,智能体可能将这些影响其奖励的中断与特定状态联系起来并故意回避它们。在多智能体情境中该情况尤其具有挑战性,因为智能体不仅可能从自身过去的中断中学习,还可能从其他智能体的中断中学习。Orseau和Armstrong为一个学习器定义了安全可中断性(safe interruptibility),但他们的工作不能自然扩展到多智能体系统。本文引入了动态安全可中断性(dynamic safe interruptibility),一种更适用于去中心化学习问题的替代定义,并在两种学习框架下研究该概念:联合动作学习器(joint action learners)和独立学习器(independent learners)。我们给出了学习算法在联合动作学习器情况下实现动态安全可中断性的现实充分条件,但表明这些条件对独立学习器并不充分。然而,我们展示如果智能体能够检测中断,则可以通过修剪观测来确保甚至独立学习器也能实现动态安全可中断性。
引用
@article{arxiv.1704.02882,
title = {Dynamic Safe Interruptibility for Decentralized Multi-Agent Reinforcement Learning},
author = {El Mahdi El Mhamdi and Rachid Guerraoui and Hadrien Hendrikx and Alexandre Maurer},
journal= {arXiv preprint arXiv:1704.02882},
year = {2017}
}