中文

离散与连续 MARL 域中针对不可预见故障的协作适应恢复框架

多智能体系统 2024-07-30 v1 机器人学

摘要

合作多智能体学习在开发实现单个或共享目标的多智能体团队策略方面发挥着关键作用。在现实环境中,智能体可能面临意外故障,例如机器人的腿故障或队友的电池耗尽。这些故障会降低团队完成任务的能力,尤其是当这些故障发生在学习算法已收敛到协作策略之后时。当前在多智能体强化学习 (MARL) 中的领先方法往往对此类故障恢复缓慢——甚至根本无法恢复。为克服这一限制,我们提出了协作适应 (CA) 框架,突出其在连续和离散域中运行的独特能力。我们的框架通过整合智能体之间的关系到其学习过程中,从而增强智能体对意外故障的适应性,加快故障恢复速度。我们通过在离散和连续环境中的实验评估了该框架的性能。实证结果表明,在涉及不可预见故障的场景中,虽然最先进的算法常常在亚最优解上收敛,但所提出的 CA 框架能够更有效地缓解和恢复。

关键词

引用

@article{arxiv.2407.19144,
  title  = {Collaborative Adaptation for Recovery from Unforeseen Malfunctions in Discrete and Continuous MARL Domains},
  author = {Yasin Findik and Hunter Hasenfus and Reza Azadeh},
  journal= {arXiv preprint arXiv:2407.19144},
  year   = {2024}
}

备注

Accepted to International Conference on Decision and Control (IEEE CDC 2024)